Научная статья предлагает метод количественной оценки гибкости электропотребления AI-ЦОД при взаимодействии с энергосистемой. Подход переносит во времени пакетные вычислительные задачи с учётом ограничений по задержке, непрерывности исполнения и доступным ресурсам CPU, GPU и памяти. Решения по планированию задач преобразуются в профиль серверной мощности, после чего оцениваются потенциал сглаживания пика и длительность устойчивого снижения нагрузки на основе реальных трасс GPU-кластера.
Какое решение описано
Предложен программный механизм demand response для AI-ЦОД: batch/offline-задачи переносятся в допустимые временные окна оптимизационной моделью, тогда как online-нагрузки не являются объектом переноса. Метод сначала агрегирует секундные трассы использования CPU, GPU и памяти до интервалов, совместимых с дискретностью энергосистемы, затем рассчитывает мощность серверов по загрузке ресурсов и оптимизирует либо гарантированное снижение пика F, либо максимальную длительность непрерывного снижения при заданном Freq.
Главное
Перенос пакетных задач позволяет представить AI-ЦОД как управляемый ресурс гибкости спроса для энергосистемы без нарушения ограничений исполнения задач.
Для оценки гибкости необходимо учитывать совместную загрузку CPU, GPU и памяти: учёт только GPU в рассмотренном сценарии существенно занижает доступное снижение мощности.
Допустимая задержка batch-задач является ключевым параметром: её увеличение повышает достижимую величину снижения нагрузки, но требует переноса большего числа задач и увеличивает длительность их сдвига.
Более мелкая временная дискретизация сохраняет больше вариантов планирования задач; укрупнение интервалов снижает максимальную достижимую гибкость.
Существует прямой компромисс между величиной требуемого снижения мощности и временем, в течение которого ЦОД способен поддерживать это снижение непрерывно.
Ключевые цифры
Мощность современных hyperscale AI-ЦОД
свыше 100 MW
Указана во введении как возможная требуемая мощность современных объектов.
Масштаб перспективных AI-ЦОД
гигаваттный
Некоторые будущие объекты, согласно статье, могут достигать gigawatt scale.
Продемонстрированное снижение мощности в cited experimental studies
25 %
Приведённый авторами пример программной оркестрации GPU-нагрузок при сохранении качества обслуживания.
Длительность снижения мощности
3 часа
Для приведённого во введении примера снижения мощности на 25%.
Число задач в использованном дневном наборе Alibaba Cluster Trace GPU v2020
7 828 задач
Данные одного дня, использованные в симуляциях.
Исходная временная дискретизация профиля нагрузки
1 с
Секундное разрешение исходных вычислительных трасс.
Типовые интервалы планирования энергосистемы
5, 15 или 60 мин
Интервалы, с которыми сопоставляется обработанная нагрузка ЦОД.
Окно оценки сглаживания пика
15:00–15:25
Заданное в эксперименте окно предоставления гибкости.
Гибкость Case 1 при γ=1,0
21,71 kW
Учитывается только мощность GPU.
Гибкость Case 2 при γ=1,0
32,47 kW
Учитываются CPU, GPU и память.
Прирост гибкости Case 2 относительно Case 1 при γ=1,0
49,6 %
Рост с 21,71 до 32,47 kW благодаря учёту CPU, GPU и памяти.
Гибкость Case 2 при γ=0
10,76 kW
Без допуска дополнительной задержки batch-задач.
Гибкость Case 1 при γ=0
8,690 kW
Вариант с учётом только GPU.
Число переносимых задач в Case 1 при γ=0
33 задачи
Результат краткосрочного сглаживания пика.
Средняя длительность сдвига в Case 1 при γ=0
97,42 мин
Для перенесённых задач в Table I.
Число переносимых задач в Case 2 при γ=0
37 задач
Результат варианта с учётом CPU, GPU и памяти.
Средняя длительность сдвига в Case 2 при γ=0
90,27 мин
Для перенесённых задач в Table I.
Длительность устойчивого снижения при γ=0,4 и требовании 10 kW
Для собственника AI-ЦОД работа даёт методику проверки, какую контрактуемую гибкость нагрузки можно реально предложить оператору сети или использовать для ограничения пиков: отдельно по величине снижения мощности и по времени его поддержания. При внедрении нужно вести ресурсную телеметрию CPU/GPU/памяти с достаточно мелкой дискретностью и формально определить допустимые окна задержки batch-нагрузок; оценка только GPU или грубые интервалы планирования могут исказить доступный потенциал.
Научная работа предлагает FissionReady — планировщик для дата-центров, питаемых многомодульной станцией малых модульных реакторов (SMR). Система совместно управляет мощностью каждого реакторного модуля, переносимой batch-нагрузкой и закупками из сети, учитывая возраст топлива, йодно-ксеноновую динамику и запас реактивности. В моделировании подход исключает вынужденные остановки и пропуски дедлайнов batch-задач, одновременно снижая водопотребление и расходы на электроэнергию из сети относительно сопоставимой базовой конфигурации.
Презентация Wärtsilä о применении модульных газовых и двухтопливных электростанций совместно с накопителями энергии для питания дата-центров, включая ИИ-нагрузки. Материал связывает дефицит сетевых присоединений с ростом спроса на первичную onsite/off-grid генерацию и приводит несколько проектов в Ирландии и США. Акцент сделан на доступности мощности, модульности, эффективности на частичной нагрузке, сокращении водопотребления и возможности последующего перехода на устойчивые виды топлива.
White paper AVK и Wärtsilä Energy рассматривает дефицит сетевой мощности как одно из ключевых ограничений роста европейских ЦОД, особенно объектов для AI-нагрузок. Авторы предлагают использовать локальные микросети с диспетчеризуемой генерацией, BESS и ВИЭ для ускорения ввода площадок до или независимо от сетевого подключения. Материал сопоставляет сценарии энергосистемы и четыре конфигурации питания типового AI-ЦОД мощностью 80 МВт по стоимости, надёжности, землепользованию и углеродному следу.