Настройка On-Call ротации для команды поддержки сайта

Мы столкнулись с ситуацией: команда поддержки из трёх человек выгорела за два месяца из-за хаотичных ночных вызовов. Инциденты копились, MTTA вырос до часа. Решение — внедрение **on-call ротации** с чёткими правилами эскалации. За две недели MTTA снизился до 5 минут, а нагрузка распределилась равном

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Настройка On-Call ротации для команды поддержки сайта
Средний
~2-3 дня

Наши компетенции:

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1414
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1285
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    982
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1241
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    982
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    994

Мы столкнулись с ситуацией: команда поддержки из трёх человек выгорела за два месяца из-за хаотичных ночных вызовов. Инциденты копились, MTTA вырос до часа. Решение — внедрение on-call ротации с чёткими правилами эскалации. За две недели MTTA снизился до 5 минут, а нагрузка распределилась равномерно. Правильная настройка окупается за первый месяц, а стоимость организации ротации варьируется в зависимости от объёма интеграций.

Анализ проблемы: почему команды выгорают на дежурствах

On-call ротация — это система, при которой ответственность за реакцию на инциденты вне рабочего времени распределяется между членами команды по очереди. Без ротации — один дежурный выгорает за месяц. С правильно настроенной ротацией — нагрузка равномерна, а реакция предсказуема. Наш опыт показывает, что weekly ротация лучше ежемесячной в 3 раза по скорости восстановления контекста.

Проектирование схемы ротации

Как выбрать период ротации?

Период Удержание контекста Alert fatigue Для каких команд
1 неделя Высокое Среднее Большинство (2–6 чел.)
2 недели Среднее Низкое Зрелые команды с низким noise
4 недели Низкое Очень низкое Крупные команды (8+)

Primary on-call: первый уровень, получает все алерты. Время реакции — 5-15 минут. Secondary on-call (backup): если primary не ответил за 10-15 минут — эскалация на secondary. Escalation path: Primary → Secondary → Engineering Manager → CTO. Каждый уровень добавляет 10-15 минут.

Инструменты онколл-системы: PagerDuty и альтернативы

Настройка эскалаций в PagerDuty

Service → Escalation Policy: Level 1: On-Call schedule (primary) - Notify after: immediately - Escalate after: 15 minutes Level 2: On-Call schedule (secondary) - Notify after: escalation - Escalate after: 15 minutes Level 3: Engineering Manager - Notify after: escalation Schedule (Primary): Rotation type: Weekly Handoff time: Monday 10:00 local time Restrictions: None (24/7 coverage) Layer 1: [Engineer A, Engineer B, Engineer C, Engineer D] 

Handoff в рабочее время — инженер принимает смену в спокойной обстановке, изучает открытые инциденты.

Интеграция с мониторингом

Интегрируйте мониторинг (Prometheus, Datadog, Sentry) с PagerDuty через webhook. Настройте smart-нотификации: днём Slack, ночью звонок. Это снижает alert fatigue и повышает MTTA.

Внедрение: пошаговая инструкция для команды

  1. Определите размер команды и часы покрытия. Для 4 человек оптимальна недельная ротация.
  2. Создайте schedule в PagerDuty/OpsGenie: укажите участников, тип ротации (weekly), время handoff (например, понедельник 10:00).
  3. Настройте escalation policy: primary получает алерт сразу, если не отвечает 15 минут — secondary, ещё 15 минут — менеджер.
  4. Настройте каналы нотификации: Slack, звонок, SMS.
  5. Проведите пилотный прогон.

Подготовка runbook и handoff-процедуры

Runbook для типовых инцидентов ускоряет реакцию. Пример: при 503 — рестартовать Nginx. Handoff-заметка содержит: список открытых инцидентов, нестабильные компоненты, запланированные изменения, «горячие» места. Шаблон в Slack или Confluence.

Обучение и пилотный прогон

Проведите обучение команды по runbook и handoff. Пилотный прогон в течение недели выявит узкие места.

Управление инцидентами: как бороться с alert fatigue

Что такое alert fatigue и как с ним бороться?

On-call работает только если алерты значимы. Если за дежурную неделю приходит 50 алертов, из которых 45 — шум, через месяц команда перестаёт реагировать. Alert fatigue — главный враг дежурного. Инструменты борьбы: alert grouping, smart-нотификации, еженедельный ревью, SLO-based alerting на burn rate.

Метрики здоровья онколл-системы

Метрика Норма Как улучшить
Incidents per week per engineer <5 Снижать alarm noise
After-hours incidents % <30% Улучшать мониторинг днём
MTTA <15 минут Усилить escalation policy
Fatigue score <3/5 Регулярные ревью, компенсация

Компенсация и удержание дежурных

On-call — это дополнительная нагрузка, которая должна компенсироваться: денежная надбавка за дежурную неделю, отгул после тяжёлой недели, компенсация за каждый ночной вызов. Команда без компенсации — команда, которая саботирует дежурство или уходит.

Сроки и что входит в настройку под ключ

  • Проектирование схемы ротации с учётом размера команды и графика
  • Настройка PagerDuty/OpsGenie: schedules, escalation policies, layers
  • Интеграция с мониторингом (Prometheus, Datadog, Sentry)
  • Конфигурация каналов нотификации: Slack, звонок, SMS
  • Документация: runbook, handoff шаблон, инструкции для дежурных
  • Обучение команды и пилотный прогон

Источник: документация PagerDuty

Сроки настройки

  • PagerDuty/OpsGenie + schedules + escalation policy — 1-2 дня
  • Интеграция с Prometheus/Datadog алертами — 1-2 дня
  • Настройка каналов нотификации (Slack, звонок, SMS) — 1 день
  • Документация процесса + обучение команды — 1-2 дня

Получите консультацию по внедрению on-call ротации для вашей команды. Свяжитесь с нами — оценим проект и предложим решение за 2 дня. Закажите настройку под ключ, и мы гарантируем снижение MTTA до 5 минут.