В ТРЕНДЕ

Проблемы эксплуатации ЦОД: мощность, охлаждение, оборудование и персонал

Эксплуатацию современных ЦОД осложняют пять взаимосвязанных факторов: дефицит электрической мощности, рост плотности стоек, длительные сроки поставки оборудования, нехватка квалифицированных специалистов и увеличение затрат.

Каждая из этих проблем знакома отрасли давно. Изменился их масштаб. Вычислительные нагрузки растут быстрее, чем энергетическая и инженерная инфраструктура, а требования к доступности ЦОД при этом не снижаются.

Новую стойку недостаточно установить в машинном зале. Для неё нужно найти электрическую мощность, проверить возможности системы охлаждения, сохранить резервирование и убедиться, что эксплуатационная команда сможет обслуживать усложнившуюся инфраструктуру.

Поэтому управление ЦОД уже не может ограничиваться контролем аварийных сигналов. Эксплуатации необходимо заранее видеть, где заканчивается доступный ресурс, какое оборудование теряет эффективность и какое ограничение помешает дальнейшему развитию площадки.

1. Дефицит электрической мощности ограничивает развитие ЦОД

Раньше главным ограничением при расширении ЦОД часто считалось свободное место. Есть незанятые стойки или площадь под их установку — значит, можно подключать новое оборудование.

Сегодня место в машинном зале может оставаться, а мощности для новой нагрузки уже не быть.

Рост облачных сервисов, искусственного интеллекта и высокопроизводительных вычислений увеличивает энергопотребление дата-центров. При этом строительство подстанций, линий электропередачи и новых вводов занимает значительно больше времени, чем развёртывание ИТ-инфраструктуры.

Но даже выделенная площадке мощность не даёт полного представления о доступном ресурсе. Ограничение может находиться внутри ЦОД: на конкретном трансформаторе, секции шин, ИБП, PDU или распределительной ветви.

Общий резерв ещё есть, а подключить новую стойку уже некуда.

Что необходимо контролировать

Для планирования мощности недостаточно знать суммарное энергопотребление ЦОД. Нужно видеть всю цепочку электроснабжения — от ввода до розетки в стойке.

Эксплуатации необходимы данные о:

  • фактической загрузке вводов, трансформаторов, ИБП и PDU;
  • распределении нагрузки по фазам;
  • доступном резерве на каждом участке;
  • состоянии основной и резервной схем;
  • мощности отдельных стоек;
  • планируемом подключении нового ИТ-оборудования.

Особенно важно учитывать резервирование. Свободная мощность в нормальном режиме не означает, что она действительно доступна. После отказа одного ввода или ИБП оставшееся оборудование должно принять дополнительную нагрузку без перегрузки.

Поэтому ответ на вопрос «можно ли установить новую стойку» нельзя получить по одному показанию счётчика. Для этого требуется связать телеметрию, топологию электроснабжения, характеристики оборудования и планы развития ИТ-инфраструктуры.

Как снизить риск дефицита мощности

Первый шаг — перейти от контроля текущего потребления к управлению доступной мощностью.

Система должна показывать:

  • где находится свободный ресурс;
  • какие элементы приближаются к пределу;
  • как изменится загрузка после подключения нового оборудования;
  • сохранится ли резервирование при отказе одного из элементов;
  • когда существующий запас мощности будет исчерпан.

Такой подход позволяет заранее перераспределить нагрузку, изменить схему подключения или запланировать модернизацию. Без этого нехватка мощности обнаруживается в самый неудобный момент — когда оборудование уже закуплено и готово к установке.

2. Высокая плотность стоек усложняет охлаждение ЦОД

Практически вся электроэнергия, потребляемая серверным оборудованием, превращается в тепло. Чем выше мощность стойки, тем больше тепла необходимо отвести из небольшого объёма машинного зала.

Для традиционных серверных нагрузок воздушного охлаждения обычно было достаточно. Холодный воздух подавался через фальшпол или непосредственно в холодные коридоры, а прецизионные кондиционеры поддерживали требуемую температуру.

GPU-кластеры и системы высокопроизводительных вычислений изменили ситуацию. Мощность отдельных стоек достигает десятков киловатт, а перспективные конфигурации рассчитаны на ещё более высокие значения.

При такой плотности недостаточно просто увеличить холодопроизводительность кондиционеров. Воздух необходимо доставить именно к оборудованию, не допустив рециркуляции и смешивания горячих и холодных потоков.

Средняя температура в машинном зале при этом может оставаться нормальной, хотя в верхней части отдельной стойки уже образовалась зона перегрева.

Почему средняя температура ничего не гарантирует

Один датчик в помещении показывает только состояние воздуха рядом с собой. Он не позволяет оценить температуру на входе каждого сервера и не обнаруживает локальные проблемы:

  • рециркуляцию горячего воздуха;
  • недостаточный расход через стойку;
  • утечки через незакрытые юниты;
  • байпас холодного воздуха;
  • неравномерную загрузку стоек;
  • неправильное размещение перфорированных плит;
  • снижение эффективности отдельного кондиционера.

Поэтому контроль охлаждения должен выполняться не только по помещению, но и по зонам, рядам и стойкам.

Нужно сопоставлять температуру на входе и выходе оборудования, мощность ИТ-нагрузки, режим работы кондиционеров и доступную холодопроизводительность.

Воздушное и жидкостное охлаждение будут работать вместе

Переход к высокой плотности не означает, что все ЦОД станут полностью жидкостными. На одной площадке могут одновременно находиться обычные серверы, системы хранения и высокоплотные GPU-стойки.

Поэтому наиболее вероятным становится смешанный подход:

  • воздушное охлаждение для стандартных нагрузок;
  • задние теплообменники для отдельных стоек;
  • прямое жидкостное охлаждение процессоров и ускорителей;
  • специализированные контуры для наиболее плотных вычислительных систем.

Для эксплуатации это означает появление новых контролируемых параметров. Помимо температуры и влажности воздуха, нужно отслеживать расход и давление теплоносителя, температуру подачи и обратки, работу насосов, состояние клапанов и наличие утечек.

Как снизить тепловые риски

Эксплуатации необходимо видеть не только факт перегрева, но и его причину.

Для этого нужно:

  • контролировать температуру на входе оборудования;
  • строить тепловые карты машинных залов;
  • сопоставлять мощность стоек с возможностями охлаждения;
  • выявлять рециркуляцию и байпас;
  • анализировать фактический вклад каждого кондиционера;
  • отслеживать постепенное снижение эффективности оборудования.

Такой анализ позволяет обнаружить проблему до того, как она приведёт к аварийному отключению серверов.

3. Длительные поставки повышают цену отказа оборудования

Трансформатор, дизель-генератор, ИБП или промышленный чиллер невозможно заменить так же быстро, как серверный блок питания.

Сроки поставки крупного инженерного оборудования могут составлять многие месяцы. Для некоторых трансформаторов и распределительных устройств речь идёт уже о периоде, сопоставимом со сроком строительства небольшого объекта.

Для российских ЦОД ситуацию дополнительно усложняют изменение логистических цепочек, ограниченная доступность оригинальных комплектующих, использование параллельно нескольких поколений оборудования и необходимость подбирать совместимые аналоги.

В результате отказ критического элемента становится не просто ремонтной задачей. Площадка может надолго остаться без необходимого уровня резервирования.

Например, ЦОД продолжит работать после отказа одного ИБП или чиллера, но следующий отказ в той же системе уже приведёт к серьёзным последствиям.

Какое оборудование требует особого контроля

Не все активы одинаково важны. В первую очередь необходимо выделить оборудование:

  • от которого зависит большая часть нагрузки;
  • не имеющее полноценного резерва;
  • с длительным сроком изготовления;
  • требующее сложного монтажа или перенастройки системы;
  • для которого отсутствует быстро доступная замена;
  • находящееся в эксплуатации дольше расчётного срока.

Для таких объектов недостаточно стандартного перечня оборудования. Нужен полноценный цифровой паспорт.

Он должен содержать характеристики, место установки, связи с другими элементами, историю обслуживания, аварии, результаты диагностики, техническую документацию, гарантийные условия и перечень возможных замен.

Почему регламентного обслуживания недостаточно

Техническое обслуживание по календарю остаётся обязательным, но оно не всегда отражает фактическое состояние оборудования.

Два одинаковых агрегата, обслуживаемые по одному регламенту, могут стареть по-разному. На это влияют загрузка, количество пусков, температура окружающей среды, качество электропитания и условия эксплуатации.

О приближении отказа могут говорить:

  • рост температуры;
  • увеличение вибрации;
  • нестабильность напряжения или тока;
  • учащение запусков;
  • снижение холодопроизводительности;
  • изменение времени выхода на рабочий режим;
  • повторяющиеся незначительные аварии.

По отдельности такие отклонения могут выглядеть несущественными. В динамике они показывают деградацию оборудования.

Как снизить зависимость от поставок

Эксплуатация должна заранее знать:

  • какие запасные части необходимо хранить на площадке;
  • какие компоненты можно заменить аналогами;
  • сколько времени займёт поставка критического оборудования;
  • при каких признаках нужно начинать закупку;
  • какие активы требуют модернизации до появления отказа.

Запасные части, договоры и поставщики становятся частью системы обеспечения надёжности ЦОД, а не только задачей отдела закупок.

4. Нехватка специалистов увеличивает риск человеческой ошибки

Современный ЦОД требует компетенций в электроснабжении, охлаждении, автоматизации, сетях, серверном оборудовании, пожарной безопасности и диспетчеризации.

Специалистов, которые хорошо понимают сразу несколько этих областей, немного. При этом инфраструктура усложняется, а количество систем и данных продолжает расти.

Дополнительная проблема заключается в том, что значительная часть знаний о конкретном объекте нигде не зафиксирована.

Опытный инженер помнит:

  • какой датчик периодически даёт ложные срабатывания;
  • какой кондиционер теряет эффективность в жаркую погоду;
  • где находится неочевидная зависимость между двумя системами;
  • в какой последовательности безопасно выполнять переключение;
  • какие признаки предшествовали прошлой аварии.

Формально это называется опытом. Для организации это критически важные эксплуатационные данные.

Когда специалист уходит, вместе с ним может исчезнуть часть фактической модели объекта.

Какие операции следует автоматизировать

Автоматизация не заменяет инженера, но позволяет освободить его от повторяющейся работы и снизить вероятность пропуска важного события.

В первую очередь автоматизируют:

  • сбор показаний оборудования;
  • контроль порогов и нормативов;
  • регистрацию аварий;
  • назначение и отслеживание работ;
  • контроль сроков технического обслуживания;
  • ведение истории изменений;
  • подготовку регулярной отчётности;
  • выявление повторяющихся отклонений.

Сотрудник не должен вручную сопоставлять данные из BMS, SCADA, журналов обхода, системы заявок и Excel-таблиц, чтобы разобраться в одной аварии.

Чем больше времени уходит на поиск информации, тем медленнее реакция и выше вероятность ошибки.

Как сохранить знания об объекте

Необходимо фиксировать не только событие, но и контекст:

  • что произошло;
  • какое оборудование было затронуто;
  • кто принял решение;
  • какие действия были выполнены;
  • почему выбран именно такой порядок;
  • каким оказался результат;
  • повторялась ли подобная ситуация раньше.

Эта информация помогает новым сотрудникам быстрее разбираться в объекте, а опытным — не полагаться исключительно на память.

Ценность DCIM в данном случае заключается не в создании ещё одного экрана с аварийными сигналами. Она появляется, когда данные инженерной и ИТ-инфраструктуры, работы персонала и история эксплуатации собраны в единой системе.

5. Рост затрат требует управлять эффективностью ЦОД

Стоимость строительства и эксплуатации ЦОД увеличивается одновременно.

Дорожают электроэнергия, оборудование, запасные части, подрядные работы и обслуживание. Увеличение сроков поставки вынуждает создавать дополнительные запасы, а дефицит специалистов повышает стоимость квалифицированного труда.

В такой ситуации возникает естественное желание сократить эксплуатационные расходы. Но прямое урезание бюджета часто создаёт только краткосрочную экономию.

Можно перенести техническое обслуживание и уменьшить расходы текущего квартала. Если позднее оборудование выйдет из строя, аварийный ремонт и работа на сниженной резервируемости обойдутся значительно дороже.

Можно повысить температурные уставки и сократить энергопотребление охлаждения. Но без достоверной тепловой картины это может привести к локальному перегреву.

Экономить безопасно можно только тогда, когда понятны технические последствия каждого решения.

Почему одного PUE недостаточно

PUE показывает соотношение общего энергопотребления ЦОД и энергии, которую получает ИТ-оборудование. Это полезный показатель для общей оценки, но он не объясняет, где именно возникают потери.

Одинаковый PUE может быть получен при совершенно разных проблемах:

  • низкой загрузке ИБП;
  • неэффективной работе кондиционеров;
  • неправильном распределении воздуха;
  • избыточном количестве работающего оборудования;
  • наличии неиспользуемых серверов;
  • ошибках в настройке инженерных систем.

Чтобы управлять энергоэффективностью, необходима детализация.

Нужно видеть:

  • потребление по системам и участкам;
  • загрузку трансформаторов и ИБП;
  • мощность отдельных стоек;
  • эффективность каждого кондиционера;
  • зависимость энергопотребления от ИТ-нагрузки;
  • изменения показателей после перенастройки оборудования.

Исправное оборудование тоже может работать неэффективно

Два кондиционера одной модели могут потреблять одинаковое количество электроэнергии, но отводить разное количество тепла.

Один работает в зоне реальной нагрузки. Второй охлаждает воздух, который не доходит до оборудования, либо получает обратно часть собственного холодного потока.

С точки зрения аварийного мониторинга оба кондиционера исправны. С точки зрения эксплуатации один из них создаёт постоянные потери.

Аналогичная ситуация возникает с ИБП, насосами, вентиляторами и другим оборудованием, работающим при неоптимальной загрузке.

Поэтому контроль исправности необходимо дополнять оценкой эффективности.

От разрозненного мониторинга к управлению ЦОД

Все перечисленные проблемы связаны между собой.

Рост ИТ-нагрузки увеличивает потребление электроэнергии и тепловыделение. Высокая плотность стоек усложняет охлаждение. Более сложная инфраструктура требует редких комплектующих и квалифицированных специалистов. Длительные поставки повышают цену отказа. Рост затрат заставляет точнее оценивать каждое техническое решение.

Управлять этими факторами в отдельных системах становится всё сложнее.

Для эксплуатации необходим единый контур данных, в котором связаны:

  • инженерное и ИТ-оборудование;
  • физическое размещение;
  • электрическая мощность;
  • холодопроизводительность;
  • телеметрия;
  • аварии;
  • техническое обслуживание;
  • документы;
  • запасные части;
  • планы развития площадки.

Отдельный датчик сообщает о повышении температуры. Связанная модель показывает, какая стойка находится в зоне риска, какое оборудование в ней установлено, какой кондиционер обслуживает этот участок и как менялась нагрузка перед возникновением проблемы.

Система электромониторинга показывает ток на PDU. Модель ЦОД позволяет понять, какой запас остаётся с учётом резервирования и можно ли безопасно подключить новую стойку.

Именно такое объединение данных превращает мониторинг в инструмент управления инфраструктурой ЦОД.

Главное — обнаружить ограничение до аварии

Современный ЦОД постоянно меняется. Устанавливается новое оборудование, растёт нагрузка, стареют инженерные системы, меняются схемы резервирования и перераспределяются ресурсы.

То, что вчера считалось достаточным запасом, завтра может стать ограничением.

Поэтому эксплуатации недостаточно знать, что сейчас все системы работают штатно. Необходимо видеть:

  • где заканчивается электрическая мощность;
  • где растёт тепловая нагрузка;
  • какое оборудование теряет эффективность;
  • какие компоненты невозможно быстро заменить;
  • какие регламентные работы отстают от плана;
  • какой ресурс будет исчерпан следующим.

Устойчивость ЦОД зависит не только от количества резервных систем. Она определяется качеством данных, полнотой цифровой модели и способностью эксплуатационной команды принять решение до того, как отклонение превратится в аварию.
Развитие индустрии Улучшаем ЦОД