Реальный кейс из нашей практики: наш клиент — розничная сеть с 300 звонками в день. QA-отдел успевал прослушать только 15% (45 звонков). Пропущенные 85% содержали нарушения сценария, падение эмпатии и пропущенные возможности продаж. Потери — до 8% выручки ежемесячно (в среднем 500 тыс. руб). Мы спроектировали AI-систему на базе GPT-4o и Whisper, которая обеспечила 100% покрытие, повысила точность оценки до 92% (по сравнению с человеком-асессором) и сократила время вывода на 70%. Экономия составила от 400 тыс. руб ежемесячно, а окупаемость — 2–3 месяца.
Система скоринга звонков (по определению Wikipedia) присваивает числовую оценку каждому звонку по стандартизированной методологии, создаёт рейтинги операторов и обнаруживает паттерны, требующие корректирующего обучения. Оценка — не двоичная (ок/не ок), а многомерная: приветствие, удержание, прощание, эмпатия, понимание проблемы, точность решения, соблюдение GDPR, эффективность AHT и FCR.
Какие проблемы реально решает AI-скоринг?
- Выборочный контроль. Человек-асессор оценивает 10–20% звонков, остальные — чёрный ящик. AI обрабатывает 100%: каждый звонок получает полный scorecard. 2. Необъективность. Усталость, субъективное восприятие, разная трактовка критериев. LLM последовательно применяет одну методологию ко всем звонкам. 3. Отсутствие трендов. Ручная оценка не даёт сводных метрик. Мы строим дашборды со скользящим средним, трендом за неделю/месяц и heatmap по типам нарушений.
Как мы это делаем: стек и кейс
Для оценки используем GPT-4o с response_format=json_object. Промпт содержит все критерии с весами, инструкцию «оцени от 0 до 10» и требование пояснить каждую оценку. Применяем fine-tuning (LoRA) для адаптации под специфику речи операторов. Для транскрибации используем Whisper с целевым WER менее 10%. В сложных случаях подключаем RAG с базой скриптов и частых вопросов.
Пример scorecard — модель Pydantic:
from pydantic import BaseModel
from typing import Optional
class CallScorecard(BaseModel):
call_id: str
operator_id: str
duration_seconds: float
# Compliance (соответствие требованиям)
greeting_score: float # 0-10
hold_procedure_score: float # 0-10
farewell_score: float # 0-10
gdpr_compliance: float # 0-10
# Quality (качество обслуживания)
problem_understanding: float # 0-10
solution_accuracy: float # 0-10
empathy_score: float # 0-10
# Efficiency (эффективность)
aht_relative: float # 0-10 (относительно целевого AHT)
first_call_resolution: float # 0 или 10
# Sales/Upsell (если применимо)
offer_made: Optional[float] = None
offer_quality: Optional[float] = None
@property
def total_score(self) -> float:
scores = [
self.greeting_score * 0.10,
self.hold_procedure_score * 0.05,
self.farewell_score * 0.05,
self.gdpr_compliance * 0.10,
self.problem_understanding * 0.20,
self.solution_accuracy * 0.25,
self.empathy_score * 0.15,
self.aht_relative * 0.05,
self.first_call_resolution * 0.05,
]
return round(sum(scores), 1)
Автоматическая оценка через LLM:
async def score_call_llm(transcript: dict) -> CallScorecard:
full_dialog = format_dialog(transcript["turns"])
response = await client.chat.completions.create(
model="gpt-4o",
messages=[{
"role": "system",
"content": """Ты эксперт по оценке качества обслуживания.
Оцени звонок по каждому критерию от 0 до 10.
Будь объективен, основывай оценку только на тексте.
Верни JSON с полями: greeting_score, hold_procedure_score, farewell_score,
gdpr_compliance, problem_understanding, solution_accuracy, empathy_score,
first_call_resolution. Для каждого поля добавь comment_FieldName с пояснением."""
}, {"role": "user", "content": full_dialog[:6000]}],
response_format={"type": "json_object"}
)
data = json.loads(response.choices[0].message.content)
return CallScorecard(
call_id=transcript["call_id"],
operator_id=transcript["operator_id"],
duration_seconds=transcript["duration"],
**{k: v for k, v in data.items() if not k.startswith("comment_")}
)
Чтобы увидеть, как это работает на ваших данных, свяжитесь с нами — мы пришлем демо-доступ.
Как настроить scorecard за 5 шагов
- Определите типы звонков (входящие/исходящие, продажи/поддержка).
- Выберите критерии из библиотеки (15 базовых, можно добавить кастомные).
- Назначьте веса каждому критерию (сумма 1.0).
- Укажите пороговые значения (например, AHT не более 300 с).
- Запустите пилот на 100 звонках и скорректируйте промпт по результатам.
Сравнение AI и человека: кто точнее?
| Метрика | AI (LLM) | Человек-асессор | Разница |
|---|---|---|---|
| Покрытие | 100% | 15% | в 6,7 раза больше |
| Скорость оценки | 2 секунды | 12 минут | в 360 раз быстрее |
| Согласованность (Корр. Пирсона) | 0.92 | 0.78 (между асессорами) | на 18% выше |
| Объективность | Высокая (одинаковые критерии) | Зависит от усталости | — |
| Стоимость за звонок | Значительно ниже | Высокая | в десятки раз дешевле |
Почему AI работает точнее человека?
LLM не устаёт, не пропускает звонки из-за нехватки времени и применяет одинаковые критерии ко всем диалогам. В нашем A/B-тесте AI показал согласованность 92% с контрольной группой (2 QA-менеджера, 100 звонков), в то время как между двумя асессорами согласованность была 78%. Это подтверждает, что автоматическая оценка не только быстрее, но и объективнее.
Что входит в работу
- Архитектура ETL для транскрибации звонков (Whisper, модели распознавания русского языка).
- Интеграция с ACD/CRM — получение звонков и обогащение данными клиента.
- Scorecard из 15 критериев — настройка весов под ваш сценарий.
- LLM-ассистент — генерация scorecard с пояснениями.
- Дашборд рейтингов и трендов — Grafana или React.
- Калибровка и мониторинг — автоматическое отслеживание корреляции AI vs человек.
Процесс работы
- Аналитика и аудит — разбираем текущие критерии оценки, скрипты, типы звонков.
- Проектирование scorecard — веса, нормы AHT, границы FCR.
- Интеграция и разметка — подключаемся к телефонии, собираем исторические записи.
- Обучение и калибровка — запускаем baseline, корректируем промпт, дообучаем модель при необходимости (LoRA).
- Тестирование A/B — сравниваем AI с ручными оценками.
- Деплой и дашборды — разворачиваем инференс, подключаем оповещения (Telegram, Slack).
Сроки ориентировочно
| Компонент | Срок |
|---|---|
| Базовая оценка (15 критериев) | 4–6 недель |
| Рейтинги операторов и тренды | 6–8 недель |
| Дашборды и уведомления | 2–4 недели дополнительно |
Стоимость рассчитывается индивидуально в зависимости от объёма звонков, требуемой латентности и необходимости fine-tuning. Закажите консультацию — мы пришлём пример scorecard и смету.
Калибровка: как поддерживаем точность
Периодически сравниваем AI-оценки с ручными оценками QA-менеджеров. Целевой показатель: корреляция Пирсона > 0.85. Если корреляция падает, запускаем перекалибровку на свежей размеченной выборке. Процесс включает:
- Сбор новых транскрибов (100 звонков)
- Разметка двумя QA-менеджерами
- Обучение LoRA-адаптера на основе расхождений
- A/B-тест на следующей неделе
Опыт нашей команды — 5+ лет в NLP и 30+ проектов колл-центров. Гарантируем прозрачность: вы получаете полный доступ к промптам, весам и логам оценок. Закажите демо-доступ, чтобы увидеть результаты на ваших данных.







