Короткий ответ: до запуска проверьте три вещи — задержку ответа (цель 500 мс), умение агента молчать в паузах и совместимость с вашей телефонией. Модель почти никогда не является причиной провала. Разбираем полный чек-лист.
Где умирают голосовые агенты
Девять из десяти демонстраций голосовых агентов выглядят убедительно. Девять из десяти внедрений разваливаются в первую неделю боевых звонков. Разрыв между демо и продом держится на трёх вещах: задержка реакции, умение молчать и работа с реальной телефонной сетью. Модель тут ни при чём — она почти всегда достаточно хороша.
Задержка
Человек начинает нервничать, когда пауза в разговоре превышает 700 миллисекунд. Классическая цепочка «телефония → STT → LLM → TTS» легко набирает полторы секунды только на передаче данных между этапами. Мы целимся в 500 мс от конца фразы абонента до начала ответа: стриминг распознавания, частичная генерация текста ещё до конца реплики и синтез, который стартует на первом предложении. Каждый лишний хоп в инфраструктуре стоит десятки миллисекунд, а каждая сотня миллисекунд стоит конверсии.
Умение слушать
Прерывания. Клиент перебивает. Агент обязан замолчать мгновенно и услышать новую формулировку. Если бот дожёвывает свой скрипт поверх человека, звонок заканчивается за пятнадцать секунд, а бренд получает минус. Правильная архитектура ловит начало речи абонента по потоковой амплитуде и отменяет текущий синтез без ожидания завершения.
Тишина и шум. «Алло, алло?» после паузы в две секунды — нормальная реакция человека. Пауза в тишину, которую агент интерпретировал как конец мысли, а потом начал длинный монолог — провал. Отдельно живут фоновые звуки: кафельный магазин, дорога, офис. Модель детекции речи обязана отделять речь собеседника от остального, иначе агент будет разговаривать с объявлениями по радио.
Что спрашивать у подрядчика
- Какая сквозная задержка на реальном звонке, а не в демо через вебсокет.
- Что происходит при прерывании на середине фразы.
- Как считается биллинг: за минуту разговора или за секунду работы четырёх сервисов сразу.
- Куда пишутся логи диалогов и кто их может прочитать.
- Что слышит клиент, когда модель не уверена. Тишина, «повторите вопрос» или честное «передаю коллеге»?
Последний пункт самый важный. Агент, который не умеет признавать границы своих знаний и передавать звонок человеку, теряет больше денег, чем экономит. Эскалация это не поражение системы, а её часть.
Экономика секунды
Считайте не стоимость минуты аренды оператора, а стоимость решённого вопроса. Голосовой агент дешевле оператора в разы, но только на типовых сценариях: подтверждение записи, статус заказа, первичная квалификация. Как только доля нестандартных диалогов растёт выше трети, экономия съедается повторными звонками недовольных. Здоровая схема: агент закрывает рутину целиком, сложное передаёт человеку вместе с расшифровкой и кратким резюме разговора.
Начинать стоит с одного узкого сценария и одной метрики: доля звонков, закрытых без передачи человеку, при сохранении оценки качества выше порога. Эта цифра скажет о проекте больше, чем любой пилотный отчёт.
Чеклист перед выводом в прод
Перед подключением боевого трафика прогоните систему по списку. Каждый пункт — это чей-то провальный запуск, который можно было предотвратить:
- Замер задержки на реальной линии. Не через вебсокет с локальной машины, а через вашу АТС и городской номер. Цель — 500 мс от конца фразы абонента до первого звука ответа; раздражение наступает после 700 мс.
- Тест прерываний. Позвоните и перебейте агента на середине фразы десятью разными способами. Он обязан замолчать мгновенно и отреагировать на новую мысль, а не договорить скрипт.
- Проверка тишины. Помолчите пять секунд, скажите «ммм», оставьте трубку у работающего телевизора. Агент не должен начинать монолог в пустоту.
- Сценарии эскалации. Задайте вопросы вне базы знаний. Правильное поведение: короткое уточнение, затем передача человеку с расшифровкой контекста.
- Нагрузочный тест. Пиковый час должен выдерживаться с запасом: очередь из звонков не должна ломать латентность.
- Юридическая рамка. Уведомление о записи, согласие на обработку персональных данных, логирование диалогов внутри вашего контура.
- Плавный трафик. Первую неделю — десять процентов входящих, контроль записей ежедневно, затем расширение. Запуск сразу на всём потоке лишает вас возможности дешёво исправить ошибки.
Типичные ошибки заказчика
Демо принимается за результат. Демо показывает идеальные условия: тихая комната, подготовленные вопросы, веб-интерфейс вместо телефона. Решение принимайте по записи боевых звонков, а не по презентации.
Ставится задача «заменить колл-центр». Размытая цель гарантирует размытый итог. Рабочий старт — один сценарий: подтверждение записи, статус заказа или первичная квалификация. Автоматизация узкого сценария закрывается за четыре–шесть недель и даёт измеримый эффект.
Игнорируется телефония. SIP-шлюз заказчика с экзотическими кодеками способен добавить полсекунды задержки и свести всю оптимизацию к нулю. Совместимость инфраструктуры проверяется до подписания договора.
Нет метрик качества после запуска. Без выборочного прослушивания диалогов и оценки доли решённых вопросов система тихо деградирует: база знаний устарела, клиенты изменили формулировки. Контроль качества — постоянный процесс, а не пункт приёмки.
Экономия на эскалации. Агент без честной передачи человеку превращает недовольного клиента во враждебного. Передача звонка вместе с резюме разговора — это часть архитектуры, а не признание поражения.
Сколько стоит голосовой агент?
Стоимость складывается из трёх частей: настройка сценария и интеграция с телефонией и CRM (разовая), инфраструктура распознавания и синтеза (поминутная или за секунду работы стека STT→LLM→TTS), сопровождение базы знаний. Биллинг «за минуту разговора» у подрядчика часто прячет оплату всех четырёх сервисов одновременно — требуйте расшифровку. MVP одного сценария занимает четыре–шесть недель; дальше масштабирование на соседние сценарии стоит заметно дешевле первого, потому что инфраструктура уже собрана.
Как быстро агент окупается?
При типовой нагрузке колл-центра средней компании — около двух месяцев. Считается просто: стоимость минуты агента ниже стоимости минуты оператора в разы, а закрытие рутины высвобождает людей для сложных разговоров, где человек действительно нужен. Ключевое условие: агент держит задержку в пределах 500 мс и корректно передаёт сложные случаи. Нарушение любого из двух условий съедает экономию повторными звонками и потерянными клиентами быстрее, чем она накапливается.
Какие процессы точно не стоит отдавать агенту?
Жёсткие переговоры о скидках, конфликтные ситуации, продажа сложных продуктов с длинным циклом решения, всё, что касается жалоб на безопасность. Там цена ошибки выше экономии, а решение требует полномочий, которых у агента нет и быть не должно. Здоровая граница: рутинные операции с предсказуемым набором исходов — агенту, остальное человеку. Пересматривайте границу по данным, а не по амбициям подрядчика.
Что измерять в первый месяц
Запуск без панели метрик — это не запуск, а надежда. Четыре цифры, которые нужно смотреть еженедельно:
- Доля звонков без передачи человеку. Главная метрика сценария. Для типовой рутины (запись, статус заказа) здоровый диапазон — семьдесят процентов и выше; ниже сорока сценарий настроен плохо или выбран неверно.
- Медианная сквозная задержка. Замеряется на реальных звонках, не в стенде. Дрейф от 500 мс к 800+ мс — сигнал деградации интеграции, и абоненты это замечают раньше вашей системы мониторинга.
- Доля диалогов, переданных оператору. Норма на старте — до трети; если меньше, скорее всего, бот «дожимает» разговоры, которые должен был отдать человеку. Слишком высокая доля — повод пересмотреть базу знаний.
- Оценка качества от абонентов и операторов. Операторы слышат неудачные диалоги первыми: их обратная связь дешевле любого аудита.
Эти четыре цифры собираются из логов телефонии за один день. Если их никто не смотрит weekly — автоматизация работает вслепую, а экономия на аналитике возвращается счётом за потерянных клиентов.