Клиент тратит минуты, пробираясь через 5 уровней тонального меню: «нажмите 1 для... нажмите 2, если...». 30% звонков сбрасываются на втором шаге. Раздражение растёт, бизнес теряет лиды. AI IVR решает это: пользователь говорит «хочу подключить интернет» и сразу попадает к нужному специалисту. Мы делаем такие системы под ключ за 2–6 недель. Подход основан на технологии интерактивного голосового меню (IVR). В одном из проектов для телеком-оператора экономия на операторах составила до нескольких сотен тысяч рублей в месяц при нагрузке 5000 звонков — за счёт сокращения времени диалога и автоматизации простых запросов.
Сравнение AI IVR и DTMF
| Параметр | DTMF IVR | AI IVR |
|---|---|---|
| Навигация | 3–5 уровней меню | 1–2 вопроса |
| Время до оператора | 60–120 сек | 10–20 сек |
| Caller experience | Низкое | Высокое |
| Точность маршрутизации | ~90% (при правильных кнопках) | 85–95% |
| Стоимость разработки | Низкая | Средняя |
AI IVR не просто копирует дерево меню — он понимает естественный язык. Клиент формулирует запрос своими словами, а NLU-модель классифицирует намерение и направляет в нужный отдел. Даже если пользователь путается в терминах, система переспросит — как живой оператор. Сравнение с DTMF: время обработки запроса сокращается в 6 раз, а точность маршрутизации выше на 5–15%.
Как AI IVR понимает естественный язык?
В основе лежит языковая модель, которая различает намерения (intents). Мы настраиваем её под бизнес-логику: техническая поддержка, биллинг, подключение услуг, общая информация.
Пример маршрутизации звонка
ROUTING_DESTINATIONS = {
"technical_support": [
"не работает", "сломалось", "ошибка", "проблема с", "техподдержка"
],
"billing": [
"оплата", "счёт", "задолженность", "списание", "тариф", "деньги"
],
"new_connection": [
"подключить", "новый договор", "тариф", "оформить", "заявка"
],
"general_info": [
"информация", "узнать", "как работает", "что такое"
]
}
async def route_call(user_text: str) -> str:
"""Определяем направление маршрутизации"""
response = await client.chat.completions.create(
model="gpt-4o-mini",
messages=[{
"role": "system",
"content": f"""Маршрутизируй звонок. Направления: {list(ROUTING_DESTINATIONS.keys())}.
Верни JSON: {{"destination": "...", "confidence": 0.0-1.0}}"""
}, {"role": "user", "content": user_text}],
response_format={"type": "json_object"}
)
result = json.loads(response.choices[0].message.content)
if result["confidence"] < 0.7:
return "clarification_needed"
return result["destination"]
Если уверенность ниже 0.7, модель переспрашивает: «Уточните, пожалуйста: вам нужна поддержка по оборудованию или по оплате?» — так снижается риск ложной маршрутизации.
Зачем нужен сбор данных в IVR?
Часто IVR должен собрать номер заказа или код подтверждения. Мы извлекаем цифры из речи — и слова «три четыре пять шесть» превращаются в строку «3456»:
DATA_COLLECTION_PROMPTS = {
"phone_verification": "Назовите последние 4 цифры вашего номера телефона.",
"order_number": "Назовите номер вашего заказа.",
"date_of_birth": "Назовите дату вашего рождения для верификации."
}
def extract_digits(text: str) -> str:
"""Извлекаем цифры из распознанного текста"""
import re
num_words = {
"один": "1", "два": "2", "три": "3", "четыре": "4",
"пять": "5", "шесть": "6", "семь": "7", "восемь": "8",
"девять": "9", "ноль": "0"
}
for word, digit in num_words.items():
text = text.replace(word, digit)
return re.sub(r'[^\d]', '', text)
Сравнение STT-провайдеров для AI IVR
| Модель | WER (русский) | Задержка (p50) | Относительная стоимость |
|---|---|---|---|
| Whisper (large-v3) | 8% | 800 мс | Низкая |
| Google STT | 10% | 600 мс | Средняя |
| Yandex STT | 9% | 700 мс | Высокая |
Выбор зависит от бюджета и требований к латентности. Для real-time IVR мы рекомендуем комбинацию Whisper (точность) + Google STT (скорость) с динамическим переключением.
Как мы тестируем AI IVR?
Мы проводим A/B-эксперимент: сначала AI IVR обрабатывает 10% звонков, сравниваем конверсию и CSAT с DTMF-группой. Критерий успеха — время до оператора менее 20 сек и точность маршрутизации выше 90%. При превышении порогов увеличиваем долю до 100%. Мониторинг в Grafana: latency p99, количество переспросов, confidence distribution.
Обеспечение качества распознавания включает фильтр шумов на основе WebRTC, нормализацию громкости LRUCache и fallback-модели: если Whisper даёт confidence < 0.5, подключаем Google STT. В production применяем многоязычные модели с поддержкой русскоязычных акцентов. В документации Twilio отмечается, что Media Streams позволяют передавать аудио в реальном времени через WebSocket, что критично для low-latency IVR. Twilio Media Streams documentation
Процесс реализации AI IVR
- Аналитика и сбор сценариев — записываем реальные диалоги, выявляем частые запросы, строим граф намерений.
- Проектирование NLU-пайплайна — выбираем LLM (обычно GPT-4o-mini для скорости и цены), настраиваем few-shot примеры, подбираем threshold для переспроса.
- Интеграция с телефонией — подключаем WebSocket к Twilio или Asterisk. Голосовой поток передаётся в STT, затем в NLU.
- Разработка сценариев и сбор данных — настраиваем промпты для сбора номера заказа, даты, кода верификации. Добавляем поддержку многократных попыток ввода.
- Тестирование и A/B-эксперимент — сравниваем с DTMF.
- Деплой и мониторинг — разворачиваем на Kubernetes с auto-scaling, логируем каждое намерение и уверенность. Настраиваем алерты на падение confidence.
Что входит в работу
- Документация: описание intents, схемы интеграции, регламент обновления модели.
- Исходный код NLU-модуля, промпты и конфиги деплоя.
- Доступ к demo-стенду для приёмки заказчиком.
- Обучение команды: как пополнять сценарии, переобучать модель в случае дрейфа намерений.
- Гарантия на NLU-модуль: поддерживаем точность классификации не ниже 90% в течение 6 месяцев после запуска.
Сроки и как оценить проект
Базовый AI IVR на 5 направлений — от 2 до 3 недель. Полная замена DTMF с аналитикой, инференсом на GPU и интеграцией с CRM — до 6 недель. Стоимость рассчитывается индивидуально. Свяжитесь с нами — мы зафиксируем ваши сценарии и пришлём оценку за 1–2 дня.
Наш опыт: 5+ лет в разработке голосовых ассистентов, более 50 проектов в ритейле, телекоме и финансах. Гарантируем, что пользователь не заметит подмены живого оператора — или доработаем модель бесплатно. Закажите demo-стенд для ваших сценариев.







