Сбой питания в зоне Yandex Cloud: компания сделала выводы и назвала причины
30 марта 2025 года произошёл серьёзный сбой в одном из ключевых дата‑центров Яндекса — сервисы, размещённые в зоне, оказались временно недоступны. Причиной стал двойной отказ линий электропитания после аварии на опорной подстанции, вызвавшей каскадные отказы оборудования.
Ключевые факты:
Авария началась в 12:18 по московскому времени. В течение нескольких минут было зафиксировано критическое занижение напряжения. Обе линии 110 кВ, питающие дата‑центр, отключились одновременно — ситуация крайне маловероятная, но всё же произошла. Дизельные генераторы и ДРИБП поддержали критическую инфраструктуру (наблюдение, сеть, управление), но не могли принять полную нагрузку. Полное восстановление сервисов заняло около 10 часов: к полуночи работа дата‑центра была полностью нормализована.
План по предотвращению повторений:
В Яндексе заявили о пересмотре рисков энергоснабжения и об усилении архитектуры резервирования. Упор будет сделан не только на технические решения (включая ДГУ), но и на операционные учения и мультизональную устойчивость. Для клиентов Yandex Cloud будет расширяться библиотека архитектур отказоустойчивости, включая инструменты вроде Zonal Shift, уже доказавшего свою эффективность в кризисной ситуации.
Яндекс подчёркивает: мультизональная архитектура — критически важна для надёжности. Опыт 30 марта — это повод для всех инженеров пересмотреть модели резервирования и подготовки к редким, но возможным аварийным сценариям.