Голосовой агент для контакт-центра — это не «модель, которая обзванивает». Это конвейер: распознавание речи, понимание запроса, ответ и синтез — и всё это должно укладываться в задержку, при которой человек не чувствует паузы. Распознавание узбекской речи здесь и есть узкое место: акценты, переключение на русский в середине фразы, банковская терминология.
Что работает из коробки
Базовая модель неплохо берёт чистую студийную речь и стандартные фразы. Для FAQ-сценариев — «остаток по карте», «часы работы», «адрес отделения» — этого почти достаточно. Проблемы начинаются на телефонном канале: сжатый звук, шум, перебивания.
Что пришлось дотягивать
Точность на доменной лексике мы поднимали не сменой модели, а данными: размеченные реальные звонки, словарь терминов, обработка кодовых переключений «узбекский ↔ русский». Отдельно боролись за латентность — стриминговое распознавание вместо ожидания конца фразы убирает самую заметную паузу.
В голосовом AI выигрывает не самая большая модель, а самый короткий и предсказуемый путь от звука до ответа.
| Участок конвейера | Базовая модель из коробки | Что пришлось дотягивать |
|---|---|---|
| Чистая студийная речь | Распознаётся стабильно | Ничего — базовой модели достаточно |
| Телефонный канал | Точность падает: сжатый звук, шум, перебивания | Дообучение на размеченных реальных звонках |
| Доменная лексика (банк, логистика, клиника) | Термины путаются и «выравниваются» под общие слова | Словарь терминов и разметка отраслевых диалогов |
| Переключение «узбекский ↔ русский» | Фраза теряется на стыке языков | Отдельная обработка кодовых переключений |
| Задержка до ответа | Ожидание конца фразы даёт слышимую паузу | Стриминговое распознавание вместо пакетного |
Вывод для тех, кто выбирает голосового вендора
Спрашивайте не «какая у вас модель», а «на каких данных она доучена под наш язык и нашу отрасль» и «какая задержка на телефонном канале». Для банков СНГ это и есть два решающих вопроса. Точные цифры по вашему контуру подтверждаются на демо.
Частые вопросы
Почему распознавание узбекской речи сложнее, чем русской
Данных для обучения меньше, а речь живая: сильные акценты, диалектные различия и переключение на русский в середине фразы. Добавьте телефонный канал со сжатым звуком и шумом — и универсальная модель, которая хорошо звучит на студийной записи, начинает терять слова.
Что даёт замена модели на более крупную
Меньше, чем ожидают. Крупная модель поднимает общее качество, но не знает вашу отраслевую лексику и добавляет задержку. Точность на доменных словах даёт дообучение на размеченных реальных звонках и словарь терминов, а не размер модели сам по себе.
Какая задержка допустима в голосовом диалоге
Ориентир простой: человек не должен чувствовать паузу после того, как договорил. Поэтому считают не время работы модели, а весь путь — распознавание, понимание, ответ и синтез. Стриминговое распознавание убирает самый заметный кусок ожидания.
Как AI справляется со смешанной узбекско-русской речью
Кодовые переключения обрабатываются отдельно: система не заставляет говорящего держаться одного языка, а распознаёт стык и продолжает фразу. Без такой обработки модель теряет вторую половину предложения — именно там чаще всего звучат цифры, суммы и названия услуг.
Что спросить у вендора голосового AI перед пилотом
Три вещи: на каких данных модель доучена под ваш язык и отрасль, какая задержка именно на телефонном канале и что происходит при нетиповом запросе. Просите проверку на ваших записях — точные цифры по контуру подтверждаются на демо, а не в презентации.
Нужны ли собственные модели или достаточно готовых
Зависит от сегмента. Малому и среднему бизнесу обычно хватает готовых моделей с настройкой под каталог и сценарий. Для enterprise с требованиями по данным и контуру речевой стек разворачивается отдельно, и объём работ обсуждается на этапе внедрения — до 30 дней.