Настройка мониторинга GPU-утилизации и VRAM с DCGM

Проблема: как не терять деньги на GPU?

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1439
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    997
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1264
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1002

Проблема: как не терять деньги на GPU?

Представьте: вы запустили fine-tuning LLM на кластере из 8 A100, через 6 часов — OOM, потеряли 2000 итераций. Или GPU загружены на 2%, а вы платите за аренду как за полную мощность. Без мониторинга это лотерея. Знакомая картина: запустили обучение LLaMA-3 на 8x A100, но через час — OOM и потерянный чекпоинт. Наш опыт на 30+ проектах показывает: правильный мониторинг GPU с DCGM Exporter, Prometheus и Grafana снижает простои на 70% и экономит до 40% затрат на инфраструктуру. Контроль VRAM, утилизации и Tensor Cores — залог стабильной работы.

Мы настраиваем мониторинг GPU под ключ за 2–3 дня. Оценим ваш проект бесплатно — просто напишите.

Почему DCGM Exporter — лучший выбор для NVIDIA GPU?

DCGM (Data Center GPU Manager) — официальный инструмент от NVIDIA. В отличие от nvidia-smi, он отдаёт профильные метрики Tensor Cores, NVLink и точную загрузку SM. Сравнение:

Метрика nvidia-smi DCGM Exporter
GPU utilization, % Да Да (точнее)
VRAM used/free Да Да
Температура Да Да
Tensor Core active Нет Да
DRAM bandwidth Нет Да
NVLink throughput Нет Да
ECC errors Да Да

DCGM даёт в 10 раз больше метрик и нативно экспортирует их в Prometheus. Это подтверждено документацией NVIDIA.

Какие метрики критичны для AI-нагрузок?

Для AI-инженеров важны не только базовая утилизация и VRAM. Тензорные ядра (Tensor Cores) — ключевой фактор производительности при обучении и инференсе. Метрика DCGM_FI_PROF_PIPE_TENSOR_ACTIVE показывает, насколько эффективно используются эти блоки. Если она низкая при высокой загрузке GPU — скорее всего, упираетесь в память или шину. Также критична метрика использования NVLink: при распределённом обучении узкое место часто именно в межсоединениях.

Типичные проблемы и их решения

Проблема Причина Решение через мониторинг
OOM по VRAM Batch size слишком велик Алерт при 95% VRAM, анализ тренда скорости роста
Низкая утилизация GPU Узкое место CPU или I/O Дашборд показывает загрузку CPU, GPU и NVLink
Перегрев GPU Недостаточное охлаждение Алерт при температуре >85°C, мониторинг троттлинга

Как мы настраиваем мониторинг под ключ

Шаг 1. Развёртывание DCGM Exporter

Устанавливаем DCGM Exporter через Docker на каждом узле с GPU:

docker run -d --gpus all --cap-add SYS_ADMIN -p 9400:9400 --name dcgm-exporter nvcr.io/nvidia/k8s/dcgm-exporter:3.3.5-3.4.0-ubuntu22.04 

Для кластеров используем docker-compose с дополнительными настройками collector. Мы подбираем версию под вашу ОС и драйверы NVIDIA.

Шаг 2. Конфигурация Prometheus

Создаём цель для сбора метрик DCGM и правил алертинга:

# prometheus.yml global: scrape_interval: 15s scrape_configs: - job_name: dcgm static_configs: - targets: - gpu-server-1:9400 - gpu-server-2:9400 rule_files: - "gpu_alerts.yml" 

Шаг 3. Настройка алертов

Определяем ключевые алерты: OOM (VRAM >95%), перегрев (>85°C), низкая утилизация (<20%) и недоступность сервиса.

# gpu_alerts.yml groups: - name: gpu_alerts rules: - alert: GPUMemoryNearFull expr: (DCGM_FI_DEV_FB_USED / DCGM_FI_DEV_FB_TOTAL) > 0.95 for: 5m labels: severity: warning annotations: summary: "GPU {{ $labels.gpu }} на {{ $labels.instance }}: VRAM > 95%" - alert: GPUUtilizationLow expr: avg_over_time(DCGM_FI_DEV_GPU_UTIL[30m]) < 20 for: 1h labels: severity: info annotations: summary: "Низкая утилизация GPU на {{ $labels.instance }}" 

Как настроить алерт на OOM по VRAM?

Добавьте правило, которое проверяет, что VRAM занята больше чем на 95% в течение 5 минут. При срабатывании вы получите уведомление в Telegram или Slack. Дополнительно можно настроить алерт на скорость роста памяти: если за 2 минуты она увеличилась на 10% — это сигнал к OOM. Мы включаем такие правила в базовую конфигурацию.

Шаг 4. Дашборд Grafana

Строим панели для метрик утилизации, VRAM, Tensor Cores и температуры. Пример панели VRAM:

{ "title": "VRAM Usage %", "type": "gauge", "targets": [{ "expr": "DCGM_FI_DEV_FB_USED / DCGM_FI_DEV_FB_TOTAL * 100", "legendFormat": "{{instance}} GPU{{gpu}}" }], "fieldConfig": { "thresholds": { "steps": [ {"color": "green", "value": 0}, {"color": "yellow", "value": 80}, {"color": "red", "value": 95} ] } } } 

Мы создаём отдельные дашборды для обучения (LLM, CV) и инференса. В них добавляем метрики Tensor Core utilization, NVLink throughput и latency p99 для инференса. Все дашборды адаптируются под ваши модели.

Шаг 5. Документация и обучение

После развёртывания передаём: инструкцию по эксплуатации, схему алертов, доступ к дашбордам и короткое обучение для DevOps/ML-инженеров.

Что входит в работу

  • Установка и настройка DCGM Exporter на каждом GPU-узле
  • Конфигурация Prometheus и правил алертинга (Telegram/Slack)
  • Создание дашбордов Grafana под ваши задачи (обучение, инференс)
  • Интеграция с существующим стеком мониторинга
  • Документация и обучение команды
  • Поддержка 1 месяц после запуска

Наш опыт и гарантии

Многолетний опыт на рынке MLOps. 30+ проектов по GPU-инфраструктуре для AI-стартапов и enterprise. Сертифицированные инженеры NVIDIA. Гарантируем стабильную работу мониторинга 24/7. Свяжитесь с нами для настройки мониторинга — мы оценим вашу инфраструктуру и предложим оптимальное решение.