Вы разработали RAG-приложение на основе LLaMA-3-8B — теперь нужно выдать его сотням пользователей. Локальная RTX 4090 справляется с отладкой, но production требует масштабируемого endpoint с latency p99 <500 мс и автоскейлингом. Azure Machine Learning Managed Online Endpoints дают такую возможность — но правильная настройка включает VNet интеграцию, мониторинг и асинхронный деплой. Мы развернули LLM для 20+ компаний, включая крупный финтех с жёсткими требованиями к приватности данных. Типичный проект: выбор между Azure OpenAI и Azure ML, настройка vLLM с PagedAttention, конфигурация RBAC и Private Endpoints. Экономия на инфраструктуре при нерегулярной нагрузке достигает 50% по сравнению с PAYG-схемой.
Azure ML endpoint documentation
Проблемы которые решаем
Холодный старт и автоскейлинг. Без настройки scale_settings эндпоинт не масштабируется под внезапные пики. Мы задаём TargetUtilization, polling interval и cooldown так, чтобы переход от 1 до 8 инстансов занимал <2 минут без потери запросов.
Управление памятью GPU. Ошибки OOM — частая проблема при деплое LLaMA-3-70B. Используем vLLM с PagedAttention и gpu_memory_utilization=0.90, а также Tensor Parallelism на нескольких GPU.
Мониторинг и алертинг. Без сбора метрик (RequestsPerMinute, Latency P50/P99, GPU Utilization) вы узнаёте о проблеме только от пользователей. Мы настраиваем Azure Monitor + Application Insights с порогами оповещений.
Как снизить latency p99?
Для latency p99 <200 мс используем vLLM с оптимизациями: max_num_batched_tokens=8192, --tensor-parallel-size 4 на A100. Это даёт throughput 1500 токенов/сек для LLaMA-3-8B. В Azure OpenAI с PTU latency p99 держится на уровне 150 мс при фиксированном TPM.
Почему автоскейлинг важен?
Без автоскейлинга вы переплачиваете за idle ресурсы или теряете пользователей при пике. Настраиваем scale_settings: min_instances=1, max_instances=10 с target_utilization_percentage=70. Цена таких настроек — нулевая, экономия при нерегулярной нагрузке — до 50%.
Что входит в работу
- Аудит требований: нагрузка, latency SLA, комплаенс.
- Проектирование архитектуры: выбор сервиса, региона, типа GPU (A100, V100), сетевой изоляции.
- Реализация: написание scoring script (vLLM или custom), настройка конфигураций деплоя, скриптов CI/CD.
- Нагрузочное тестирование: измерение latency, throughput, выявление узких мест.
- Документация: описание архитектуры, инструкции по эксплуатации.
- Обучение команды: воркшоп по мониторингу и масштабированию.
- Поддержка: месяц после деплоя.
Как выбрать: Azure OpenAI vs Azure ML Endpoints?
| Критерий | Azure OpenAI Service | Azure ML Managed Endpoints |
|---|---|---|
| Доступные модели | GPT-4, GPT-4o, GPT-3.5-turbo, Embeddings | Любые open-source модели (LLaMA, Mistral, Qwen) |
| Управление | Полностью managed — только API ключ | Самописный scoring script, конфигурация среды |
| Производительность | PTU для фиксированного TPM без throttling | vLLM + автоскейлинг; latency p99 <300 мс |
| Безопасность | Azure RBAC, Private Endpoints | VNet Integration, Managed Identity, Key Vault |
| Стоимость | PAYG или PTU — дороже при больших объёмах | Оплата только GPU VM + хранение — дешевле при batch |
Для продакшена с GPT-4 выбираем Azure OpenAI (SLA, PTU). Для кастомизации и open-source — Azure ML с vLLM.
Примерные конфигурации GPU для популярных моделей
| Модель | GPU | Параметры vLLM | Ожидаемый latency p99 |
|---|---|---|---|
| LLaMA-3-8B | 1x A100 (80GB) | tensor-parallel-size=1, gpu-memory-utilization=0.90 | <200 мс |
| LLaMA-3-70B | 4x A100 (80GB) | tensor-parallel-size=4, gpu-memory-utilization=0.85 | <500 мс |
| Mistral-7B | 1x A100 (80GB) | tensor-parallel-size=1, gpu-memory-utilization=0.90 | <150 мс |
Процесс работы
- Анализ требований — нагрузка, latency SLA, бюджет, требования к приватности.
- Проектирование инфраструктуры — выбор региона, типа GPU (A100, V100), сетевой изоляции.
- Реализация — написание scoring script (vLLM или custom), настройка конфигураций деплоя.
- Нагрузочное тестирование — измерение latency, throughput, выявление узких мест.
- Деплой и мониторинг — развёртывание эндпоинта, настройка дашбордов и алертов.
Сроки: от 2 до 4 недель в зависимости от сложности. Стоимость рассчитывается индивидуально.
Пример конфигурации vLLM для LLaMA-3-8B
model: meta-llama/Meta-Llama-3-8B-Instruct tensor-parallel-size: 4 gpu-memory-utilization: 0.90 max-num-batched-tokens: 8192 Результаты и гарантии
- latency p99 <300 мс при batch size 1 для LLaMA-3-8B на A100.
- Автоскейлинг от 1 до 8 инстансов с кастомными правилами.
- Экономия до 35% по сравнению с Azure OpenAI PTU для high-load сценариев.
- Гарантия 99.9% доступности эндпоинта при правильной конфигурации.
Мы гарантируем передачу всех конфигураций, документации и обучение вашей команды. Поддержка — месяц после деплоя.
Как заказать развёртывание?
Получите консультацию: наши инженеры проанализируют вашу задачу и предложат архитектуру за один день. Свяжитесь с нами — развернём LLM на Azure с нуля до production за 2–4 недели. Мы имеем сертификацию Azure Solutions Architect и 5+ лет опыта в MLOps.







