Веб-приложение в финтехе падает в 3 часа ночи, SLA обещает 99.9%, а ошибка конфигурации мониторинга стоит контракта. Реальный случай: клиент терял до 5% пользователей при каждом простое, пока мы не настроили корректные SLI и burn-rate алерты. SLA-мониторинг — это не просто uptime-чекер, а система измерения и управления надёжностью. Мы настраиваем его под ключ для веб-приложений любой сложности. Опыт 10+ лет, более 50 проектов с мониторингом, сертифицированные инженеры. Если вы не знаете, как отслеживать выполнение SLA, или хотите автоматизировать алерты — свяжитесь с нами, получите консультацию. Гарантируем прозрачность метрик и своевременные уведомления.
Какие метрики отслеживать в SLA?
| Метрика | Описание | Типичное SLO |
|---|---|---|
| Availability (доступность) | Процент времени корректной работы | 99.9% |
| P95 latency | 95-й перцентиль времени ответа | < 500 мс |
| Error rate | Доля ошибок 5xx | < 0.1% |
SLA (Service Level Agreement) определяет целевые показатели. Availability (доступность) — формула: (total_time - downtime) / total_time * 100%. Для 99.9% SLA допустимо ~8.7 часов простоя в год, для 99.99% — 52 минуты.
Response Time — P95 и P99 важнее среднего: среднее скрывает хвост медленных запросов. Типичные цели: P95 < 500ms, P99 < 2s.
Error Rate — процент 5xx — цель < 0.1% для продакшена.
Как настроить SLA-мониторинг на Prometheus?
- Определяем SLI (Service Level Indicators): uptime, P95/P99 latency, error rate, throughput.
- Формируем SLO (Service Level Objectives): 99.9% uptime, P95 < 500ms, ошибки < 0.1%.
- Записываем правила Prometheus для расчёта SLI/SLO и алертов по burn rate.
# Правило для availability SLO (цель: 99.9%) - record: job:availability:ratio_rate5m expr: | 1 - ( rate(http_requests_total{status=~"5.."}[5m]) / rate(http_requests_total[5m]) ) # Алерт: SLO под угрозой (burn rate > 14.4x за 1 час) - alert: SLOBurnRateTooHigh expr: | job:availability:ratio_rate5m < 0.999 and rate(http_requests_total{status=~"5.."}[1h]) > 0 for: 2m labels: severity: critical annotations: summary: "SLO availability at risk" - Настраиваем дашборд в Grafana для визуализации SLO, error budget и burn rate.
- Добавляем внешние проверки (Pingdom, Blackbox Exporter) из разных точек мира.
Как выбрать инструмент сбора метрик?
Prometheus + Grafana даёт полный контроль и экономит бюджет, но требует DevOps-инженера для обслуживания. Datadog проще в развёртывании, но при больших объёмах метрик стоимость растёт в разы — Prometheus позволяет обрабатывать в 5 раз больше метрик на том же железе. Внешние мониторы вроде Uptime Robot — лёгкое дополнение, но не заменяют внутренних метрик. Выбор зависит от объёма данных и бюджета.
| Инструмент | Преимущества | Недостатки |
|---|---|---|
| Prometheus + Grafana | Бесплатно, гибкость, контроль | Требует DevOps-инженера |
| Datadog | Быстрый старт, богатые интеграции | Высокая стоимость при росте метрик |
| Uptime Robot | Простота, внешние проверки из 5+ точек | Только uptime, без внутренних метрик |
Почему error budget важен?
Error budget — допустимое время простоя за период (например, 43 минуты в месяц при SLO 99.9%). Он балансирует надёжность и скорость разработки: если бюджет не исчерпан — можно выпускать фичи быстрее, если исчерпан — приоритет — надёжность. Мы настраиваем автоматический расчёт error budget в Grafana и алерты при его исчерпании. Согласно Site Reliability Engineering от Google, error budget позволяет принимать обоснованные решения о релизах.
Одна из самых частых ошибок — установка слишком жёстких SLO без учёта стоимости инфраструктуры. Например, требование 99.99% доступности для внутреннего сервиса может увеличить затраты в 2–3 раза без ощутимой пользы. Другая ошибка — отсутствие валидации метрик: если Prometheus не снимает данные с нужного эндпоинта, SLA становится фикцией. Рекомендуем начинать с 99.9% и корректировать на основе данных.
Что входит в настройку SLA-мониторинга
- Установка и настройка Prometheus, Grafana, Alertmanager (на вашей инфраструктуре или в облаке)
- Прописывание SLI/SLO и алертов по burn rate
- Дашборд с SLO, error budget, трендами
- Внешние проверки (Uptime Robot или Blackbox Exporter)
- Автоматическая ежемесячная отчётность (PDF)
- Документация по мониторингу
- Доступы к дашбордам и алертам
- Обучение команды (1 час)
- Поддержка 2 недели после сдачи
На рынке более 5 лет, реализовали 50+ проектов с мониторингом. Используем только проверенные стеки, гарантируем SLA ответа инженера — 1 час. Получите консультацию — пишите. Закажите настройку SLA-мониторинга под ключ.
SLA-отчётность
Автоматический ежемесячный отчёт для бизнеса: фактический uptime vs целевой, список инцидентов, использование error budget, тренд. Grafana генерирует PDF по расписанию, для enterprise — Datadog SLO Reports.
Сроки настройки
| Этап | Срок |
|---|---|
| Prometheus + Grafana + базовые SLI | 2–3 дня |
| SLO rules + error budget dashboard | 1–2 дня |
| Внешние проверки + алерты | 1 день |
| Настройка отчётности | 1–2 дня |
Итоговый срок — от 5 до 8 рабочих дней в зависимости от сложности системы.







