Мы столкнулись с ситуацией: команда поддержки из трёх человек выгорела за два месяца из-за хаотичных ночных вызовов. Инциденты копились, MTTA вырос до часа. Решение — внедрение on-call ротации с чёткими правилами эскалации. За две недели MTTA снизился до 5 минут, а нагрузка распределилась равномерно. Правильная настройка окупается за первый месяц, а стоимость организации ротации варьируется в зависимости от объёма интеграций.
Анализ проблемы: почему команды выгорают на дежурствах
On-call ротация — это система, при которой ответственность за реакцию на инциденты вне рабочего времени распределяется между членами команды по очереди. Без ротации — один дежурный выгорает за месяц. С правильно настроенной ротацией — нагрузка равномерна, а реакция предсказуема. Наш опыт показывает, что weekly ротация лучше ежемесячной в 3 раза по скорости восстановления контекста.
Проектирование схемы ротации
Как выбрать период ротации?
| Период | Удержание контекста | Alert fatigue | Для каких команд |
|---|---|---|---|
| 1 неделя | Высокое | Среднее | Большинство (2–6 чел.) |
| 2 недели | Среднее | Низкое | Зрелые команды с низким noise |
| 4 недели | Низкое | Очень низкое | Крупные команды (8+) |
Primary on-call: первый уровень, получает все алерты. Время реакции — 5-15 минут. Secondary on-call (backup): если primary не ответил за 10-15 минут — эскалация на secondary. Escalation path: Primary → Secondary → Engineering Manager → CTO. Каждый уровень добавляет 10-15 минут.
Инструменты онколл-системы: PagerDuty и альтернативы
Настройка эскалаций в PagerDuty
Service → Escalation Policy: Level 1: On-Call schedule (primary) - Notify after: immediately - Escalate after: 15 minutes Level 2: On-Call schedule (secondary) - Notify after: escalation - Escalate after: 15 minutes Level 3: Engineering Manager - Notify after: escalation Schedule (Primary): Rotation type: Weekly Handoff time: Monday 10:00 local time Restrictions: None (24/7 coverage) Layer 1: [Engineer A, Engineer B, Engineer C, Engineer D] Handoff в рабочее время — инженер принимает смену в спокойной обстановке, изучает открытые инциденты.
Интеграция с мониторингом
Интегрируйте мониторинг (Prometheus, Datadog, Sentry) с PagerDuty через webhook. Настройте smart-нотификации: днём Slack, ночью звонок. Это снижает alert fatigue и повышает MTTA.
Внедрение: пошаговая инструкция для команды
- Определите размер команды и часы покрытия. Для 4 человек оптимальна недельная ротация.
- Создайте schedule в PagerDuty/OpsGenie: укажите участников, тип ротации (weekly), время handoff (например, понедельник 10:00).
- Настройте escalation policy: primary получает алерт сразу, если не отвечает 15 минут — secondary, ещё 15 минут — менеджер.
- Настройте каналы нотификации: Slack, звонок, SMS.
- Проведите пилотный прогон.
Подготовка runbook и handoff-процедуры
Runbook для типовых инцидентов ускоряет реакцию. Пример: при 503 — рестартовать Nginx. Handoff-заметка содержит: список открытых инцидентов, нестабильные компоненты, запланированные изменения, «горячие» места. Шаблон в Slack или Confluence.
Обучение и пилотный прогон
Проведите обучение команды по runbook и handoff. Пилотный прогон в течение недели выявит узкие места.
Управление инцидентами: как бороться с alert fatigue
Что такое alert fatigue и как с ним бороться?
On-call работает только если алерты значимы. Если за дежурную неделю приходит 50 алертов, из которых 45 — шум, через месяц команда перестаёт реагировать. Alert fatigue — главный враг дежурного. Инструменты борьбы: alert grouping, smart-нотификации, еженедельный ревью, SLO-based alerting на burn rate.
Метрики здоровья онколл-системы
| Метрика | Норма | Как улучшить |
|---|---|---|
| Incidents per week per engineer | <5 | Снижать alarm noise |
| After-hours incidents % | <30% | Улучшать мониторинг днём |
| MTTA | <15 минут | Усилить escalation policy |
| Fatigue score | <3/5 | Регулярные ревью, компенсация |
Компенсация и удержание дежурных
On-call — это дополнительная нагрузка, которая должна компенсироваться: денежная надбавка за дежурную неделю, отгул после тяжёлой недели, компенсация за каждый ночной вызов. Команда без компенсации — команда, которая саботирует дежурство или уходит.
Сроки и что входит в настройку под ключ
- Проектирование схемы ротации с учётом размера команды и графика
- Настройка PagerDuty/OpsGenie: schedules, escalation policies, layers
- Интеграция с мониторингом (Prometheus, Datadog, Sentry)
- Конфигурация каналов нотификации: Slack, звонок, SMS
- Документация: runbook, handoff шаблон, инструкции для дежурных
- Обучение команды и пилотный прогон
Источник: документация PagerDuty
Сроки настройки
- PagerDuty/OpsGenie + schedules + escalation policy — 1-2 дня
- Интеграция с Prometheus/Datadog алертами — 1-2 дня
- Настройка каналов нотификации (Slack, звонок, SMS) — 1 день
- Документация процесса + обучение команды — 1-2 дня
Получите консультацию по внедрению on-call ротации для вашей команды. Свяжитесь с нами — оценим проект и предложим решение за 2 дня. Закажите настройку под ключ, и мы гарантируем снижение MTTA до 5 минут.







