Константин Струлев
Директор компании «Цодум»
Константин Струлев, директор компании «Цодум», поделился с RUБЕЖ наблюдениями о том, как DCIM помогает заметить изменения в работе инфраструктуры еще до возникновения инцидента. Материал адресован специалистам ИБ, инженерам и архитекторам, которые отвечают за безопасность, эксплуатацию и устойчивость инфраструктуры и которым важно не только реагировать на инциденты, но и понимать, можно ли заметить проблему заранее.
Короткий ответ — иногда можно. И, что интересно, не всегда через привычные инструменты безопасности.
Почему проблемы почти всегда «намекают» заранее
Если разбирать любой серьезный инцидент задним числом, почти всегда находится момент, когда система уже вела себя не совсем так, как обычно, но инцидент еще не произошел. Где-то изменилась динамика нагрузки, где-то появилось отклонение, которое сначала выглядело незначительным.
Проблема в том, что такие сигналы редко воспринимаются как что-то важное. Они не выглядят как ошибка и не вызывают тревоги. Скорее наоборот — воспринимаются как часть нормальной работы.
В итоге на них либо не обращают внимания, либо просто не придают значения.
Когда «чуть иначе» — это уже сигнал
DCIM в этой истории полезен тем, что позволяет смотреть на инфраструктуру не только как на набор состояний, но и как на поведение.
Не просто есть нагрузка или нет, а как она меняется со временем. Не просто есть потребление, а насколько оно похоже на привычное.
И в какой-то момент становятся заметны отклонения, которые сложно описать как проблему, но и нормой их уже не назовешь.
Кейс: незаметные изменения перед проблемой
В одном ЦОД со временем заметили, что в определенной зоне изменилась динамика работы. Не было скачков или аварий, но система стала вести себя «ровнее», чем обычно, а затем начали появляться небольшие отклонения.
Сначала это выглядело как статистический шум. Но при более внимательном наблюдении стало понятно, что картина изменилась устойчиво.
Разбор показал, что часть оборудования работает в пограничном режиме из-за проблем с охлаждением. Не настолько серьезных, чтобы вызвать аварию, но уже влияющих на поведение системы. Если конкретнее — охлаждающие вентиляторы оборудования переключились из из периодического в постоянный режим работы.
Если бы на это не обратили внимания, вопрос был бы не «будет ли проблема», а «когда она проявится».
Но благодаря тому, что изменение заметили заранее, удалось вмешаться до того, как ситуация стала критичной.
Почему такие сигналы легко пропустить
Главная сложность в том, что инфраструктура редко сигналит о небольших изменениях явно. Она скорее меняет «почерк» своей работы.
Если нет привычки смотреть на систему именно так — как на набор паттернов, — эти изменения проходят мимо.
Большинство инструментов реагирует на события. DCIM же может показывать фон, на котором эти события происходят.
И иногда именно в этом фоне и появляется первый намек на проблему.
Кейс: лишний потребитель, которого никто не ждал
В другой ситуации внимание привлекло небольшое, но устойчивое изменение энергопотребления в одной из стоек. Никаких скачков, никаких аварий — просто уровень стал чуть выше, чем раньше.
На первый взгляд это выглядело как обычная вариация.
Но при более внимательном анализе стало понятно, что изменение не случайное. Оно держится стабильно и не связано с рабочей нагрузкой.
В итоге выяснилось, что в контуре появился дополнительный потребитель, который не проходил через стандартные процессы учета. Он не создавал проблем сам по себе, но находился вне контроля и постепенно влиял на общий баланс.
Это не был инцидент. Это был сигнал, который позволил вовремя задать правильный вопрос.
Где здесь безопасность
На первый взгляд всё это больше похоже на эксплуатацию. Но на практике это напрямую связано с безопасностью.
Любое отклонение от нормального поведения — это повод разобраться. Потому что за ним может стоять как безобидное изменение, так и реальный риск.
И чем раньше появляется понимание, что система ведет себя иначе, тем больше возможностей отреагировать спокойно, а не в режиме инцидента.
Почему это важно
Со временем становится очевидно, что безопасность — это не только защита от внешних угроз и реакция на события. Это еще и способность замечать изменения внутри собственной инфраструктуры.
DCIM в этом смысле добавляет важный слой наблюдения. Он не заменяет другие инструменты, но позволяет увидеть то, что иначе остается фоном.
И часто именно такие «фоновые» изменения оказываются самыми ценными с точки зрения предупреждения проблем.
В следующей статье попробуем собрать все эти наблюдения вместе и посмотреть шире — как данные инфраструктуры в целом начинают работать на управление рисками и бизнесом, а не только на мониторинг.

