В ТРЕНДЕ

Электропитание AI-серверов: почему рост мощности меняет инфраструктуру ЦОД

Внедрение AI-серверов обычно обсуждают в контексте производительности GPU, пропускной способности сети и жидкостного охлаждения. Но прежде чем отвести тепло от вычислителей, к ним необходимо доставить электрическую мощность — от внешнего ввода ЦОД до каждого процессора и ускорителя.

Именно эта цепочка становится одним из главных ограничений для дальнейшего роста вычислительной плотности.

Мощность отдельной стойки с AI-оборудованием уже измеряется десятками, а в перспективе — сотнями киловатт. При этом физические размеры стойки почти не меняются. Следовательно, через те же или сопоставимые объёмы оборудования необходимо передать значительно больше энергии, преобразовать её в несколько уровней напряжения и обеспечить стабильное питание микросхем, способных резко менять нагрузку.

Поэтому развитие AI-инфраструктуры меняет электропитание сразу на двух уровнях. На уровне ЦОД приходится пересматривать распределение мощности между вводами, ИБП, шинопроводами, PDU и стойками. Внутри сервера — сокращать количество преобразований, повышать напряжение распределения и приближать источники питания непосредственно к вычислительным компонентам.

Это не две отдельные задачи. Потери на каждом участке превращаются в тепло, увеличивают нагрузку на охлаждение, ухудшают PUE и сокращают объём мощности, который можно использовать для полезных вычислений.

Почему традиционная схема питания перестаёт справляться

Электропитание обычного сервера представляет собой последовательность преобразований.

Переменный ток поступает в блок питания, преобразуется в постоянный, затем понижается до напряжений, необходимых системной плате, памяти, накопителям, процессорам и ускорителям. На каждом этапе возникают потери. Чем выше передаваемый ток и сопротивление проводников, тем больше энергии выделяется в виде тепла.

Для сравнительно маломощных серверов эти потери не создавали критической проблемы. Но при переходе к стойкам на десятки и сотни киловатт даже небольшая разница в эффективности становится заметной.

Если условная линия питания теряет 5% передаваемой энергии, то в стойке мощностью 100 кВт пять киловатт превращаются в тепло ещё до выполнения вычислительной задачи. Эту энергию сначала приходится оплатить, а затем ещё раз потратить электричество на её отвод системой охлаждения.

Поэтому борьба идёт уже не только за эффективность ИБП или блока питания. Оптимизировать приходится всю цепочку доставки энергии.

Повышение напряжения снижает потери

Один из основных способов передать больше мощности без пропорционального увеличения токов — повысить напряжение.

Физика здесь достаточно проста: мощность равна произведению напряжения и силы тока. Если передать ту же мощность при более высоком напряжении, ток уменьшится. Вместе с ним снижаются потери в проводниках, которые пропорциональны квадрату силы тока.

Именно поэтому в серверной инфраструктуре происходит переход от традиционного распределения на 12 В к шинам 48 В. Одновременно рассматриваются архитектуры с подачей высокого постоянного напряжения ближе к серверному оборудованию — вплоть до схем порядка 400–800 В.

Это не означает, что процессоры будут непосредственно питаться таким напряжением. Перед микросхемой оно всё равно должно быть понижено до единиц или даже долей вольта. Меняется место преобразования: высокое напряжение передаётся на большее расстояние, а окончательное понижение происходит как можно ближе к нагрузке.

Так удаётся уменьшить токи на протяжённых участках, сократить сечение проводников и снизить потери.

От 230 В к 48 В и 800 В: где проходят границы ответственности

При обсуждении новых архитектур важно разделять несколько уровней электропитания.

На уровне здания находятся внешние вводы, трансформаторы, распределительные устройства, ИБП, ДГУ и магистральные шинопроводы. Здесь эксплуатация ЦОД управляет доступной мощностью, резервированием и качеством электроэнергии.

На уровне стойки работают стоечные PDU, внутренние шины питания и блоки питания серверов. Здесь необходимо контролировать фактическое потребление, распределение нагрузки и запас до предельных значений.

Внутри сервера располагается собственная сеть питания — Power Delivery Network, или PDN. Она включает преобразователи, проводники системной платы, конденсаторы, катушки индуктивности и элементы корпуса микросхемы. Её задача — доставить к процессорам и ускорителям стабильное напряжение даже при резких изменениях вычислительной нагрузки.

DCIM не управляет отдельными конденсаторами на плате и не проектирует внутреннюю PDN сервера. Но свойства этой сети непосредственно влияют на эксплуатацию ЦОД.

Чем выше потери внутри оборудования, тем больше его фактическое энергопотребление и тепловыделение. Чем сильнее скачки нагрузки, тем жёстче требования к блокам питания, PDU, ИБП и системе распределения. Поэтому при планировании AI-инфраструктуры нельзя рассматривать сервер как устройство с постоянной паспортной мощностью.

AI-ускорители создают резкие перепады нагрузки

Энергопотребление обычного сервера также меняется, но современные AI-ускорители делают это особенно быстро и в широком диапазоне.

Во время обучения модели вычислительные блоки могут почти одновременно переходить от сравнительно низкой загрузки к пиковой. Возникает резкий запрос на дополнительный ток. Если система питания реагирует недостаточно быстро, напряжение на микросхеме кратковременно снижается.

Такое падение называют voltage droop — просадкой напряжения. Она длится недолго, но способна вызвать ошибки вычислений, снижение частоты, срабатывание защиты или нестабильную работу ускорителя.

Для борьбы с просадками применяют локальные преобразователи и накопительные элементы, размещённые как можно ближе к микросхеме. Чем короче путь между источником энергии и нагрузкой, тем быстрее система реагирует на изменение потребления.

Отсюда появляется новая тенденция: преобразователи напряжения постепенно перемещаются с системной платы ближе к корпусу процессора, под него или непосредственно внутрь вычислительного модуля.

Для эксплуатации ЦОД эти процессы скрыты внутри сервера. Однако их внешнее проявление вполне измеримо: быстрые и значительные колебания потребляемой мощности стойки.

Паспортная мощность стойки больше не описывает её поведение

При расчёте классической серверной стойки часто использовали достаточно простую модель: определяли суммарную мощность установленного оборудования, применяли коэффициент одновременности и проверяли возможности электроснабжения и охлаждения.

Для AI-кластера этого может быть недостаточно.

Две стойки с одинаковой средней мощностью способны по-разному воздействовать на инфраструктуру. Одна потребляет энергию относительно равномерно, другая создаёт синхронные пики при выполнении отдельных этапов вычислений.

Среднее значение при этом не показывает:

  • кратковременную нагрузку на PDU;
  • амплитуду и скорость изменения мощности;
  • баланс нагрузки по фазам;
  • влияние нескольких стоек, работающих синхронно;
  • запас ИБП и распределительных устройств при пиковом режиме;
  • дополнительное тепловыделение в момент максимальной загрузки.

Поэтому для AI-инфраструктуры особенно важен мониторинг с достаточной частотой сбора данных. Усреднение за длительный интервал может полностью скрыть кратковременный пик.

Что необходимо контролировать на уровне ЦОД

Переход к более мощным серверам требует сквозного мониторинга электроснабжения — от ввода до конкретной стойки.

Эксплуатации нужны не только показания общей мощности, но и данные о:

  • загрузке трансформаторов и вводов;
  • состоянии и запасе мощности ИБП;
  • нагрузке секций распределения и шинопроводов;
  • токах по фазам;
  • активной и полной мощности;
  • коэффициенте мощности;
  • потреблении отдельных PDU и стоек;
  • кратковременных пиковых значениях;
  • скорости изменения нагрузки;
  • качестве электропитания;
  • потерях на отдельных участках цепи.

Эти данные необходимо сопоставлять с конфигурацией ИТ-оборудования. Без связи между электрическими параметрами и составом стойки невозможно понять, какой сервер или вычислительная задача вызвали изменение режима.

Полезную картину даёт именно объединение инженерной и ИТ-телеметрии. Например, рост энергопотребления стойки можно сопоставить с загрузкой GPU, температурой на входе серверов и изменением режима охлаждения.

Тогда система показывает не просто скачок мощности, а его причину и последствия.

Потери электропитания увеличивают нагрузку на охлаждение

Любая энергия, потерянная при передаче и преобразовании, в конечном счёте превращается в тепло.

Поэтому эффективность электропитания и эффективность охлаждения нельзя рассматривать независимо. Улучшение одного участка цепи даёт двойной результат: сокращается собственно потребление электроэнергии и уменьшается количество тепла, которое необходимо отвести.

Особенно заметен этот эффект внутри высокоплотной стойки. Дополнительные несколько киловатт потерь приходится удалять из того же ограниченного объёма, где уже работают GPU, процессоры, память, сетевые адаптеры и блоки питания.

При этом жидкостное охлаждение обычно отводит тепло от наиболее мощных компонентов — прежде всего процессоров и ускорителей. Другие элементы сервера могут по-прежнему охлаждаться воздухом.

Это создаёт неочевидную проблему. После перехода на жидкостное охлаждение общий воздушный поток через сервер может уменьшиться, а пассивные компоненты, преобразователи и накопители окажутся в менее благоприятных условиях.

Следовательно, жидкостное охлаждение не отменяет температурный мониторинг внутри стойки. Напротив, необходимо контролировать, как изменение воздушных потоков влияет на элементы, не подключённые к жидкостному контуру.

Почему стойка на 100 кВт — не просто десять стоек по 10 кВт

Высокоплотная стойка отличается от набора менее мощных стоек не только общей величиной потребления.

В ней значительно выше концентрация тока, тепла и стоимости оборудования. Отказ одного элемента распределения затрагивает сразу большую вычислительную мощность. Ошибка в расчёте охлаждения создаёт локальный перегрев, который невозможно компенсировать средней температурой по залу. Даже кратковременное ограничение питания может одновременно повлиять на несколько дорогостоящих ускорителей.

Поэтому для таких стоек необходимо отдельно оценивать:

  • допустимую мощность каждого пути питания;
  • резервирование на уровне серверных блоков питания и PDU;
  • возможность работы после отказа одного ввода;
  • фактические пиковые нагрузки;
  • распределение тепла внутри стойки;
  • способность охлаждения отвести нагрузку в наиболее тяжёлом режиме;
  • влияние стойки на соседнее оборудование;
  • последствия её аварийного отключения.

Простого контроля «есть питание — нет питания» здесь явно недостаточно.

Как планировать размещение AI-серверов

Размещение AI-оборудования должно начинаться не с поиска свободных юнитов, а с проверки доступных ресурсов.

Перед установкой необходимо определить:

  1. Какую мощность стойка потребляет в среднем и на пике.
  2. Как быстро изменяется нагрузка.
  3. Как мощность распределяется между вводами.
  4. Сохранится ли допустимый режим после отказа одного элемента.
  5. Какое количество тепла будет передаваться в воздух и жидкостный контур.
  6. Достаточны ли расход и температура теплоносителя.
  7. Не создаст ли новая стойка ограничение для дальнейшего развития ряда или зала.

Эти расчёты должны выполняться по фактической топологии ЦОД. Общего знания о свободной мощности площадки недостаточно: электрический резерв может находиться в одной части зала, а охлаждающий — в другой.

Именно поэтому учёт ресурсов ЦОД должен связывать место, питание, охлаждение, сетевые подключения и характеристики устанавливаемого оборудования.

Какие задачи решает DCIM при работе с AI-нагрузкой

Внутренняя архитектура питания AI-сервера остаётся зоной ответственности его разработчика. Задача DCIM начинается там, где сервер становится частью инфраструктуры ЦОД.

Система управления должна обеспечивать:

  • учёт установленного AI-оборудования;
  • привязку серверов к стойкам, PDU и путям электроснабжения;
  • контроль текущей и пиковой мощности;
  • расчёт доступного резерва;
  • выявление перегрузок и дисбаланса фаз;
  • сопоставление мощности и тепловой нагрузки;
  • анализ поведения стойки при разных вычислительных режимах;
  • прогноз исчерпания электрических и охлаждающих ресурсов;
  • оценку последствий подключения нового оборудования.

Особое значение имеет хранение истории. После запуска кластера проектные расчёты нужно сравнить с реальными данными: насколько фактическая нагрузка соответствует ожидаемой, как часто возникают пики, какие режимы охлаждения используются и где остаётся резерв.

Без такой проверки ЦОД продолжает эксплуатироваться на основании допущений, сделанных до ввода оборудования.

Экономия одного процента становится существенной

В обычном серверном помещении разница в эффективности на один процент может выглядеть незначительной. В крупном AI-кластере она превращается в заметный объём энергии и денег.

Причём потери накапливаются по всей цепочке:

  • в трансформаторах;
  • ИБП;
  • распределительных устройствах;
  • кабелях и шинопроводах;
  • стоечных PDU;
  • блоках питания;
  • внутренних преобразователях сервера.

Не все эти участки находятся под контролем одной службы или одного производителя. Но для владельца ЦОД важен итоговый результат: сколько электроэнергии поступило на площадку и какая её часть была использована непосредственно для вычислений.

Поэтому оптимизация электропитания должна опираться на измерения, а не только на паспортные коэффициенты эффективности.

Фактические потери зависят от загрузки оборудования. ИБП или блок питания могут показывать высокий КПД в расчётной точке и работать заметно хуже при частичной нагрузке. То же относится к распределению мощности между стойками и фазами.

Электропитание становится частью управления вычислениями

Граница между инженерной и ИТ-инфраструктурой постепенно размывается.

Раньше система электроснабжения обеспечивала вычислительное оборудование ресурсом, а серверы использовали его практически независимо от инженерного контура. В AI-инфраструктуре их работа всё теснее связана.

При дефиците мощности можно ограничивать частоты ускорителей, изменять расписание вычислительных задач или переносить нагрузку между площадками. При ухудшении охлаждения — снижать производительность отдельных узлов до восстановления нормального режима. При появлении свободной мощности — запускать отложенные задачи.

Для этого данные о состоянии электроснабжения и охлаждения должны быть доступны системам управления вычислительной инфраструктурой. В обратную сторону ЦОД должен получать прогноз ожидаемой нагрузки, а не узнавать о ней только после роста потребления.

Так появляется замкнутый контур управления: вычислительная нагрузка учитывает возможности инженерной инфраструктуры, а инфраструктура готовится к предстоящему изменению нагрузки.

Следующий уровень вычислений требует нового уровня прозрачности

Рост мощности AI-серверов не ограничивается заменой одного поколения оборудования другим. Он меняет всю архитектуру доставки энергии — от распределения по зданию до питания отдельной микросхемы.

Напряжение становится выше, преобразователи перемещаются ближе к нагрузке, токи и тепловые потоки концентрируются в меньшем объёме, а потребление меняется быстрее. В результате привычные расчёты по средней мощности перестают давать полную картину.

ЦОДу необходимо знать не только, сколько энергии потребляет площадка, но и как она проходит по всей цепочке, где возникают потери, какие элементы приближаются к пределу и как вычислительная нагрузка влияет на инженерные системы.

Главная задача эксплуатации — не просто обеспечить AI-серверы питанием. Она состоит в том, чтобы доставить нужную мощность в нужную точку, сохранить резервирование, отвести выделившееся тепло и оставить ресурс для дальнейшего роста.

Без сквозного мониторинга и связной цифровой модели сделать это становится всё сложнее.
2026-07-20 10:00 Развитие индустрии