Исходная ситуация
У крупного клиента произошёл отказ двух контуров источников бесперебойного питания. После этого серверы были ошибочно выключены. Инфраструктурой пользовались более 100 активных пользователей, при этом в праздничный день работу продолжали более 40 человек.
Название клиента, его финансовые показатели и внутренняя схема не публикуются. Эти данные не нужны, чтобы показать техническую логику действий.
Почему нельзя было просто включить всё сразу
После некорректного выключения важно учитывать состояние дисковых массивов, порядок запуска сервисов и зависимости между серверами. Поспешный параллельный запуск не даёт понимания, какой компонент мешает восстановлению, и может усложнить диагностику.
Последовательность действий
- Выезд на площадку — около пяти часов с момента отправления.
- Фиксация доступного состояния серверов и электропитания.
- Проверка RAID и базовой доступности зависимых компонентов.
- Запуск терминального сервера.
- Запуск сервера 1С на Microsoft SQL Server.
- Проверка зависимых сервисов и доступности пользовательских сценариев.
Что было критично
Приоритет определялся не количеством включённых машин, а тем, какие сервисы необходимы продолжающим работать пользователям. Отдельно контролировалось, что запуск одного компонента не маскирует проблему другого.
Результат в границах известных фактов
Восстановительные работы заняли около восьми часов. Были выполнены диагностика, запуск терминального сервера, запуск сервера 1С на Microsoft SQL Server, проверка RAID и зависимых сервисов.
В кейсе сознательно нет утверждения о точных предотвращённых потерях, SLA или стопроцентной сохранности данных: эти сведения не были подтверждены и не должны использоваться как реклама.
Что полезно вынести
- порядок восстановления должен учитывать сервисные зависимости;
- состояние ИБП и сценарий штатного выключения — часть серверной инфраструктуры;
- доступные резервные копии и документация сокращают неопределённость;
- аварийная работа не заменяет последующий разбор причин и профилактику.