Короткий ответ: до запуска проверьте три вещи — задержку ответа (цель 500 мс), умение агента молчать в паузах и совместимость с вашей телефонией. Модель почти никогда не является причиной провала. Разбираем полный чек-лист.

Где умирают голосовые агенты

Девять из десяти демонстраций голосовых агентов выглядят убедительно. Девять из десяти внедрений разваливаются в первую неделю боевых звонков. Разрыв между демо и продом держится на трёх вещах: задержка реакции, умение молчать и работа с реальной телефонной сетью. Модель тут ни при чём — она почти всегда достаточно хороша.

Задержка

Человек начинает нервничать, когда пауза в разговоре превышает 700 миллисекунд. Классическая цепочка «телефония → STT → LLM → TTS» легко набирает полторы секунды только на передаче данных между этапами. Мы целимся в 500 мс от конца фразы абонента до начала ответа: стриминг распознавания, частичная генерация текста ещё до конца реплики и синтез, который стартует на первом предложении. Каждый лишний хоп в инфраструктуре стоит десятки миллисекунд, а каждая сотня миллисекунд стоит конверсии.

Умение слушать

Прерывания. Клиент перебивает. Агент обязан замолчать мгновенно и услышать новую формулировку. Если бот дожёвывает свой скрипт поверх человека, звонок заканчивается за пятнадцать секунд, а бренд получает минус. Правильная архитектура ловит начало речи абонента по потоковой амплитуде и отменяет текущий синтез без ожидания завершения.

Тишина и шум. «Алло, алло?» после паузы в две секунды — нормальная реакция человека. Пауза в тишину, которую агент интерпретировал как конец мысли, а потом начал длинный монолог — провал. Отдельно живут фоновые звуки: кафельный магазин, дорога, офис. Модель детекции речи обязана отделять речь собеседника от остального, иначе агент будет разговаривать с объявлениями по радио.

Что спрашивать у подрядчика

  1. Какая сквозная задержка на реальном звонке, а не в демо через вебсокет.
  2. Что происходит при прерывании на середине фразы.
  3. Как считается биллинг: за минуту разговора или за секунду работы четырёх сервисов сразу.
  4. Куда пишутся логи диалогов и кто их может прочитать.
  5. Что слышит клиент, когда модель не уверена. Тишина, «повторите вопрос» или честное «передаю коллеге»?

Последний пункт самый важный. Агент, который не умеет признавать границы своих знаний и передавать звонок человеку, теряет больше денег, чем экономит. Эскалация это не поражение системы, а её часть.

Экономика секунды

Считайте не стоимость минуты аренды оператора, а стоимость решённого вопроса. Голосовой агент дешевле оператора в разы, но только на типовых сценариях: подтверждение записи, статус заказа, первичная квалификация. Как только доля нестандартных диалогов растёт выше трети, экономия съедается повторными звонками недовольных. Здоровая схема: агент закрывает рутину целиком, сложное передаёт человеку вместе с расшифровкой и кратким резюме разговора.

Начинать стоит с одного узкого сценария и одной метрики: доля звонков, закрытых без передачи человеку, при сохранении оценки качества выше порога. Эта цифра скажет о проекте больше, чем любой пилотный отчёт.

Чеклист перед выводом в прод

Перед подключением боевого трафика прогоните систему по списку. Каждый пункт — это чей-то провальный запуск, который можно было предотвратить:

  1. Замер задержки на реальной линии. Не через вебсокет с локальной машины, а через вашу АТС и городской номер. Цель — 500 мс от конца фразы абонента до первого звука ответа; раздражение наступает после 700 мс.
  2. Тест прерываний. Позвоните и перебейте агента на середине фразы десятью разными способами. Он обязан замолчать мгновенно и отреагировать на новую мысль, а не договорить скрипт.
  3. Проверка тишины. Помолчите пять секунд, скажите «ммм», оставьте трубку у работающего телевизора. Агент не должен начинать монолог в пустоту.
  4. Сценарии эскалации. Задайте вопросы вне базы знаний. Правильное поведение: короткое уточнение, затем передача человеку с расшифровкой контекста.
  5. Нагрузочный тест. Пиковый час должен выдерживаться с запасом: очередь из звонков не должна ломать латентность.
  6. Юридическая рамка. Уведомление о записи, согласие на обработку персональных данных, логирование диалогов внутри вашего контура.
  7. Плавный трафик. Первую неделю — десять процентов входящих, контроль записей ежедневно, затем расширение. Запуск сразу на всём потоке лишает вас возможности дешёво исправить ошибки.

Типичные ошибки заказчика

Демо принимается за результат. Демо показывает идеальные условия: тихая комната, подготовленные вопросы, веб-интерфейс вместо телефона. Решение принимайте по записи боевых звонков, а не по презентации.

Ставится задача «заменить колл-центр». Размытая цель гарантирует размытый итог. Рабочий старт — один сценарий: подтверждение записи, статус заказа или первичная квалификация. Автоматизация узкого сценария закрывается за четыре–шесть недель и даёт измеримый эффект.

Игнорируется телефония. SIP-шлюз заказчика с экзотическими кодеками способен добавить полсекунды задержки и свести всю оптимизацию к нулю. Совместимость инфраструктуры проверяется до подписания договора.

Нет метрик качества после запуска. Без выборочного прослушивания диалогов и оценки доли решённых вопросов система тихо деградирует: база знаний устарела, клиенты изменили формулировки. Контроль качества — постоянный процесс, а не пункт приёмки.

Экономия на эскалации. Агент без честной передачи человеку превращает недовольного клиента во враждебного. Передача звонка вместе с резюме разговора — это часть архитектуры, а не признание поражения.

Сколько стоит голосовой агент?

Стоимость складывается из трёх частей: настройка сценария и интеграция с телефонией и CRM (разовая), инфраструктура распознавания и синтеза (поминутная или за секунду работы стека STT→LLM→TTS), сопровождение базы знаний. Биллинг «за минуту разговора» у подрядчика часто прячет оплату всех четырёх сервисов одновременно — требуйте расшифровку. MVP одного сценария занимает четыре–шесть недель; дальше масштабирование на соседние сценарии стоит заметно дешевле первого, потому что инфраструктура уже собрана.

Как быстро агент окупается?

При типовой нагрузке колл-центра средней компании — около двух месяцев. Считается просто: стоимость минуты агента ниже стоимости минуты оператора в разы, а закрытие рутины высвобождает людей для сложных разговоров, где человек действительно нужен. Ключевое условие: агент держит задержку в пределах 500 мс и корректно передаёт сложные случаи. Нарушение любого из двух условий съедает экономию повторными звонками и потерянными клиентами быстрее, чем она накапливается.

Какие процессы точно не стоит отдавать агенту?

Жёсткие переговоры о скидках, конфликтные ситуации, продажа сложных продуктов с длинным циклом решения, всё, что касается жалоб на безопасность. Там цена ошибки выше экономии, а решение требует полномочий, которых у агента нет и быть не должно. Здоровая граница: рутинные операции с предсказуемым набором исходов — агенту, остальное человеку. Пересматривайте границу по данным, а не по амбициям подрядчика.

Что измерять в первый месяц

Запуск без панели метрик — это не запуск, а надежда. Четыре цифры, которые нужно смотреть еженедельно:

  • Доля звонков без передачи человеку. Главная метрика сценария. Для типовой рутины (запись, статус заказа) здоровый диапазон — семьдесят процентов и выше; ниже сорока сценарий настроен плохо или выбран неверно.
  • Медианная сквозная задержка. Замеряется на реальных звонках, не в стенде. Дрейф от 500 мс к 800+ мс — сигнал деградации интеграции, и абоненты это замечают раньше вашей системы мониторинга.
  • Доля диалогов, переданных оператору. Норма на старте — до трети; если меньше, скорее всего, бот «дожимает» разговоры, которые должен был отдать человеку. Слишком высокая доля — повод пересмотреть базу знаний.
  • Оценка качества от абонентов и операторов. Операторы слышат неудачные диалоги первыми: их обратная связь дешевле любого аудита.

Эти четыре цифры собираются из логов телефонии за один день. Если их никто не смотрит weekly — автоматизация работает вслепую, а экономия на аналитике возвращается счётом за потерянных клиентов.