Температура и влажность
Температура в холодных и горячих коридорах, у стоек, на входе и выходе оборудования, влажность в помещении. Градиент по высоте стойки как признак недостаточного расхода воздуха.
Температура в серверной, кондиционеры, питание и вода на полу — до того, как «упадёт» оборудование. Остаток автономной работы известен в часах, а не в предположениях.
Оборудование в серверной отказывает не само по себе — почти всегда из-за инженерной инфраструктуры вокруг него.
Температура в холодных и горячих коридорах, у стоек, на входе и выходе оборудования, влажность в помещении. Градиент по высоте стойки как признак недостаточного расхода воздуха.
Работа прецизионных кондиционеров и сплит-систем, ротация между агрегатами, автоматический ввод резерва при отказе, состояние наружных блоков, обмерзание и аварии.
Наличие напряжения на вводах, положение аппаратов, работа схемы АВР, ток и нагрузка по фидерам стоек, распределение нагрузки по фазам.
Режим работы, заряд, расчётный остаток автономной работы при текущей нагрузке, наработка батарей и приближение к сроку замены, переход на байпас, аварии.
Готовность к пуску, факт запуска и время работы, уровень топлива с пересчётом в часы, заряд стартерных батарей, результаты плановых тестовых запусков.
Датчики протечки под фальшполом, у кондиционеров и трубопроводов, контроль вскрытия двери и стоек, сигналы систем пожарной сигнализации и газового пожаротушения.
Задача — не управлять серверами, а гарантировать, что условия для их работы не выйдут за допустимые пределы незаметно.
Одного датчика в помещении недостаточно: перегрев обычно локальный и начинается в верхней части конкретной стойки.
Распределённая сеть датчиков температуры и влажности: в холодном и горячем коридорах, на входе воздуха в стойки и на выходе, по высоте стойки для контроля градиента. Архив по каждой точке, тепловая картина помещения, отдельные уставки для разных зон. Растущий градиент по высоте или сокращающийся запас до аварийного порога говорят о том, что расход воздуха уже на пределе — это позволяет спланировать доработку до того, как случится перегрев.
Отказ одного кондиционера в серверной без резерва — это считанные минуты до превышения допустимой температуры.
Контроль работы прецизионных кондиционеров и сплит-систем по цифровому интерфейсу или по дискретным сигналам, ротация между агрегатами для равномерной наработки, автоматический ввод резерва при отказе основного. Контроль наружных блоков и режимов работы в холодный период. Скорость роста температуры при отказе — сама по себе полезный показатель: она определяет, сколько реально есть времени на реакцию, и её стоит знать заранее, а не выяснять во время аварии.
Ключевой вопрос при отключении — сколько времени осталось, и ответ должен быть в часах.
Опрос источников бесперебойного питания по цифровому интерфейсу: режим, заряд, нагрузка, расчётный остаток автономной работы при фактической нагрузке, состояние и наработка батарей. Контроль вводов, схемы АВР и дизель-генератора с уровнем топлива в пересчёте на часы. Оборудование мониторинга питается через ИБП, поэтому сообщение о пропаже основного питания уходит уже после события. Отдельное оповещение о работе на резервном источнике дольше заданного времени — чтобы «сидим на батареях» не обнаружилось по их разряду.
Вода в серверной — редкая, но фатальная авария, и датчик протечки стоит несопоставимо дешевле последствий.
Кабельные датчики протечки под фальшполом, точечные — у внутренних блоков кондиционеров, у дренажных линий и трубопроводов, проходящих через помещение или над ним. Контроль вскрытия двери помещения и дверей стоек с фиксацией времени и продолжительности. Интеграция сигналов систем пожарной сигнализации и газового пожаротушения в общий контур наблюдения — при сохранении их полной самостоятельности как систем безопасности.
В серверной время реакции измеряется минутами, поэтому цепочка оповещения важнее красивого интерфейса.
Многоуровневые пороги: предупреждение при приближении к границе, авария при её пересечении, отдельная градация по скорости изменения. Каналы: SMS, электронная почта, Telegram, push, с эскалацией по цепочке ответственных и квитированием. Передача событий в существующую систему мониторинга ИТ-инфраструктуры по стандартным протоколам, чтобы инженерные аварии попадали в тот же контур, где дежурная смена уже работает, а не требовали отдельного окна.
Локальный рост температуры в верхней части стойки виден задолго до того, как сработает защита оборудования. Реакция начинается с предупреждения, а не с отключения серверов.
Остаток времени работы от батарей и запас топлива в часах — это не расчёт на бумаге, а измеряемая величина при фактической нагрузке. Решение об эвакуации нагрузки принимается по цифрам.
Дренаж кондиционера или трубопровод над помещением дают течь предсказуемо. Разница между обнаружением через минуту и через смену — это разница между уборкой и заменой оборудования.
Нагрузка по фидерам и распределение по фазам показывают реальный резерв. Решение о размещении нового оборудования принимается по замерам, а не по проектным цифрам.
Объём системы определяется критичностью, а не площадью помещения.
Одно помещение, несколько стоек, пара кондиционеров и ИБП. Минимальный набор: температура, протечка, питание, вскрытие. Разворачивается быстро и стоит немного.
Распределённые датчики по коридорам и стойкам, резервирование кондиционирования, контроль нагрузки по фидерам, интеграция с системой мониторинга ИТ.
Узлы и базовые станции без персонала: температура, питание, автономность, вскрытие. Приоритет — автономная работа оборудования телеметрии и гарантированное оповещение.
Одного в помещении недостаточно — перегрев почти всегда локальный. Минимально разумный набор для небольшой серверной: холодный и горячий коридор плюс верхняя часть наиболее загруженной стойки. В машинном зале датчики ставят по коридорам и на входе воздуха в стойки, а также по высоте для контроля градиента. Растущий градиент означает, что расход воздуха на пределе, и это видно задолго до аварии.
Система опрашивает источники бесперебойного питания по цифровому интерфейсу и получает расчётный остаток автономной работы при фактической нагрузке, а не паспортный. Для дизель-генератора уровень топлива пересчитывается в часы работы при текущем потреблении. Отдельно отслеживается скорость роста температуры при отказе кондиционирования — она определяет реальное время на реакцию и её полезно знать заранее.
Да, и обычно так и делают. Инженерные аварии передаются в существующую систему мониторинга по стандартным протоколам, чтобы дежурная смена работала в привычном интерфейсе и не следила за отдельным окном. Параллельно сохраняется независимый канал оповещений на телефон — на случай, если проблема затронет саму ИТ-инфраструктуру, включая систему мониторинга.
Нет, и не должно. Пожарная сигнализация и газовое пожаротушение остаются полностью самостоятельными системами со своей логикой и сертификацией — мы только принимаем от них сигналы для отображения и оповещения. Наша задача в этой части — довести информацию до людей, а не участвовать в работе защиты.
Как правило, да. Источником воды чаще всего оказывается не водопровод, а дренаж внутренних блоков кондиционеров, а также трубопроводы, проходящие в перекрытии над помещением или в смежных помещениях. Кабельный датчик под фальшполом и точечные у кондиционеров стоят несопоставимо дёшево по сравнению с последствиями, поэтому экономить на этом смысла нет.
Да, и там оно особенно востребовано. Набор точек минимальный — температура, наличие питания, автономность, вскрытие, — но требования к самой телеметрии выше: оборудование должно питаться независимо и передавать сообщение о пропаже питания уже после события. На удалённых узлах применяется сотовый канал с локальным архивом и, при необходимости, автономное питание контроллера.
Инфраструктура серверной — это те же инженерные системы, только с высокой ценой отказа.
Оставьте заявку — пришлём схему и состав работ под вашу площадку.