Ручная проверка звонков охватывает лишь 3–5% записей. Типичный контакт-центр с 100 операторами тратит на ручной QA до 10 человеко-часов в день на эту выборку, при этом 70% ошибок остаются незамеченными. AI-система обрабатывает все 100% диалогов за час, выявляя нарушения стандартов в реальном времени. Мы сталкивались с ситуациями, когда операторы игнорировали скрипт, клиенты злились из-за долгого ожидания, а руководители QA не видели полной картины — ручная выборка давала ложное ощущение контроля. Мы внедрили такие решения в 30+ контакт-центрах, сократив затраты на QA в среднем на 60%. Экономия бюджета на QA может превышать 60% для крупных проектов. В основе — NLP-модели, включая GPT-4, LLaMA и собственные fine-tuned модели.
Почему AI-оценка точнее ручной?
Человек оценивает субъективно: усталость, настроение, личная симпатия влияют на баллы. AI оперирует одинаковыми критериями для каждого звонка — никаких «сегодня пятница». Сравнение: ручная проверка — 10–15 звонков в день; AI — 1000+ звонков за час. AI-оценка в 200 раз быстрее ручной, а точность при грамотной настройке достигает 95%, что подтверждено McKinsey Global Institute.
Архитектура QA-системы
from dataclasses import dataclass
from typing import Callable
@dataclass
class QACriterion:
id: str
name: str
weight: float # вес в итоговой оценке
evaluator: Callable # функция оценки
class CallQAEvaluator:
def __init__(self, scorecard: list[QACriterion]):
self.scorecard = scorecard
async def evaluate_call(self, call_id: str, transcript: dict) -> dict:
scores = {}
total_weighted = 0
total_weight = sum(c.weight for c in self.scorecard)
for criterion in self.scorecard:
score = await criterion.evaluator(transcript)
scores[criterion.id] = {
"name": criterion.name,
"score": score, # 0-10
"weight": criterion.weight
}
total_weighted += score * criterion.weight
final_score = total_weighted / total_weight
return {
"call_id": call_id,
"final_score": round(final_score, 1),
"grade": self._score_to_grade(final_score),
"breakdown": scores,
"violations": [c for c in self.scorecard if scores[c.id]["score"] < 5]
}
Что включает оценка каждого критерия?
Каждый критерий реализуется как асинхронная функция-оценщик. Например, для приветствия используем GPT-4o-mini с системным промптом, который проверяет пять подкритериев и возвращает число от 0 до 10. Такой подход позволяет гибко настраивать логику без переписывания кода.
async def evaluate_greeting(transcript: dict) -> float:
"""Оценка приветствия (0–10)"""
first_agent_text = next(
(t["text"] for t in transcript["turns"] if t["speaker"] == "OPERATOR"), ""
)
response = await client.chat.completions.create(
model="gpt-4o-mini",
messages=[{
"role": "system",
"content": """Оцени приветствие оператора от 0 до 10.
Критерии:
- Назвал имя компании (+2)
- Назвал своё имя (+2)
- Поздоровался уважительно (+2)
- Предложил помощь (+2)
- Тон доброжелательный (+2)
Верни только число."""
}, {"role": "user", "content": first_agent_text}]
)
try:
return min(10, max(0, float(response.choices[0].message.content.strip())))
except ValueError:
return 5.0
async def evaluate_hold_notification(transcript: dict) -> float:
"""Предупредил ли оператор о постановке на удержание"""
hold_keywords = ["подождите", "поставлю на удержание", "одну минуту"]
agent_texts = " ".join(t["text"].lower() for t in transcript["turns"]
if t["speaker"] == "OPERATOR")
return 10.0 if any(kw in agent_texts for kw in hold_keywords) else 0.0
Типовой чек-лист (20 критериев)
| Категория | Критерии | Вес |
|---|---|---|
| Приветствие | Имя, компания, доброжелательность | 15% |
| Идентификация | Верификация клиента | 10% |
| Понимание проблемы | Уточнение, активное слушание | 20% |
| Решение | Компетентность, правильность | 25% |
| Завершение | Резюме, удовлетворённость | 15% |
| Соответствие стандартам | Запреты, compliance | 15% |
Сравнение: ручная проверка vs AI
| Параметр | Ручная проверка | AI-система |
|---|---|---|
| Охват звонков | 3–5% | 100% |
| Скорость оценки | 10–15 звонков/день | 1000+ звонков/час |
| Объективность | Субъективна | Единые критерии |
| Стоимость за звонок | Высокая | В 10–20 раз ниже |
| Анализ тона | Субъективно | Анализ тона, громкости, пауз |
Закажите разработку индивидуального чек-листа под ваш бизнес.
Как калибруется модель оценки?
На старте параллельно оцениваем 500 звонков вручную и AI. Сравниваем результаты, корректируем веса критериев и промпты. Используем метрики: точность, полноту, F1-меру. Процесс калибровки занимает 2–4 недели. Для калибровки мы используем данные реальных диалогов: собираем выборку из 500 звонков, где эксперты уже проставили оценки. Далее запускаем несколько вариантов промптов и выбираем лучший по метрикам. Это позволяет достичь точности 95% уже на второй неделе.
Как внедрить QA-систему за 4–6 недель?
- Аудит текущих стандартов — собираем чек-листы, скрипты, записи.
- Разработка критериев — адаптируем под ваш бизнес (веса, пороги).
- Интеграция с ATC/CRM — подключаемся к вашей телефонии и CRM.
- Запуск и калибровка — первые 2 недели параллельная оценка с человеком, корректировка модели.
Что входит в работу
- Документация: API-спецификация, инструкция по настройке критериев.
- Исходный код: репозиторий с модулями оценщиков.
- Дашборды: Power BI или Grafana с детализацией по операторам, категориям, временным рядам.
- Обучение: 2–3 воркшопа для QA-менеджеров и администраторов.
- Поддержка: 1 месяц пост-релизной поддержки.
Опыт компании
Более 5 лет на рынке AI-решений. 30+ реализованных проектов QA для контакт-центров и ритейла. Команда сертифицирована по NLP и MLOps (TensorFlow, PyTorch). Используем лучшие практики: RAG, fine-tuning, LoRA для дообучения моделей. Наши инженеры владеют стеком PyTorch, Hugging Face, LangChain и умеют дообучать модели под специфику вашего бизнеса.
Сроки и стоимость
Базовый модуль с 10 критериями — 4–6 недель. Полная система с дашбордами — до 3 месяцев. Стоимость рассчитывается индивидуально. Свяжитесь с нами для оценки вашего проекта — это бесплатно.
Пример дашборда: недельный отчёт оператора
- Динамика оценки за месяц (график)
- Топ-3 сильных сторон: приветствие, решение проблемы
- Топ-3 слабых: время ответа, резюме
- Примеры лучшего и худшего звонков (ссылки на аудио)
- Рекомендации: «Проходи тренинг по активному слушанию»
Получите консультацию по внедрению AI-оценки качества — закажите бесплатный аудит ваших процессов. Контролируйте 100% диалогов и экономьте до 60% бюджета на QA.







