Мониторинг: что смотреть кроме «сервер жив»
Доступность сервера — самая бесполезная метрика: сервер бывает жив, когда бизнес уже стоит.
Мониторинг имеет смысл, если он ловит проблему раньше пользователя. Значит, смотреть надо не на состояние железа, а на признаки того, что процессы идут.
Минимальный набор
- Регламентные задания: выполнились ли, за какое время, не выросло ли оно вдвое.
- Очереди обмена: сколько операций ждёт и растёт ли очередь.
- Время отклика ключевых операций — проведение документа, открытие списка заказов, оформление на кассе.
- Свободное место на диске и рост базы.
- Успешность резервного копирования.
Хорошее оповещение отвечает на вопрос «что сломалось у людей», а не «какой график изменился».
Оповещения, которые читают
Если алертов больше нескольких в день, их перестают открывать. Поэтому у каждого оповещения должен быть адресат, порог, при котором оно действительно означает проблему, и понятное действие. Всё остальное — дашборд для разбора, а не сигнал.
Что даёт эксплуатация с мониторингом
Обращения приходят от системы, а не от директора. Инциденты разбираются по данным, а не по воспоминаниям. И появляется история: видно, что операция замедлялась две недели, а не «внезапно всё сломалось».
Мы используем Zabbix и собственные проверки на стороне 1С и web-сервисов, чтобы видеть не только инфраструктуру, но и бизнес-процессы поверх неё.
Похожая задача у вас?
Расскажите ситуацию — скажем, что делали в подобных проектах и с чего начать.