Резервная копия, которую никто не проверял
Бэкап есть почти у всех. Восстановление отрабатывали немногие. Разница выясняется в самый неудачный момент.
Копия, которую никто не разворачивал, — это не резервная копия, а надежда. Она может быть повреждена, содержать не все базы, лежать на том же диске, что и продуктив, или сниматься в момент, когда часть операций ещё не завершена.
Что входит в рабочий регламент
- Расписание, привязанное к бизнесу: суточная копия перед началом ночных операций и отдельные копии перед обновлениями и релизами.
- Хранение вне того сервера, который копируем, и желательно вне того же помещения.
- Контроль срока хранения — сколько копий и за какой период мы держим.
Главный пункт — регулярная проверка восстановления. Не «файл на месте», а развёрнутая копия, в которой открывается база, сходятся итоги и работают обмены. Это единственный способ узнать, что копия рабочая, не в момент аварии.
Пока восстановление не отработано, у компании нет резервной копии — есть файл неизвестного качества.
Целевые показатели
Полезно заранее договориться о двух числах: сколько данных мы готовы потерять (глубина отката) и сколько времени готовы стоять при восстановлении. Из этих чисел следует всё остальное: частота копий, способ хранения, необходимость реплики.
Без такого разговора любой регламент выглядит достаточным до первой аварии, а после неё оказывается, что бизнес считал допустимым простой в час, а восстановление физически занимает восемь.
Как мы это ведём
Копирование ставим автоматическим, проверку восстановления — регулярной задачей с ответственным инженером, а результаты фиксируем: когда проверяли, что развернули, сколько это заняло. Тогда в момент инцидента разговор идёт о сроках, а не о вероятностях.
Похожая задача у вас?
Расскажите ситуацию — скажем, что делали в подобных проектах и с чего начать.