Инженерия

Распознавание узбекской речи в production: что работает

Голосовой AI на узбекском упирается не в модель, а в данные и латентность. Разбираем, где теряются миллисекунды и точность — и как мы их вернули.

9 мин чтения

ASR · LATENCY

Голосовой агент для контакт-центра — это не «модель, которая обзванивает». Это конвейер: распознавание речи, понимание запроса, ответ и синтез — и всё это должно укладываться в задержку, при которой человек не чувствует паузы. Распознавание узбекской речи здесь и есть узкое место: акценты, переключение на русский в середине фразы, банковская терминология.

Что работает из коробки

Базовая модель неплохо берёт чистую студийную речь и стандартные фразы. Для FAQ-сценариев — «остаток по карте», «часы работы», «адрес отделения» — этого почти достаточно. Проблемы начинаются на телефонном канале: сжатый звук, шум, перебивания.

Что пришлось дотягивать

Точность на доменной лексике мы поднимали не сменой модели, а данными: размеченные реальные звонки, словарь терминов, обработка кодовых переключений «узбекский ↔ русский». Отдельно боролись за латентность — стриминговое распознавание вместо ожидания конца фразы убирает самую заметную паузу.

В голосовом AI выигрывает не самая большая модель, а самый короткий и предсказуемый путь от звука до ответа.
Участок конвейераБазовая модель из коробкиЧто пришлось дотягивать
Чистая студийная речьРаспознаётся стабильноНичего — базовой модели достаточно
Телефонный каналТочность падает: сжатый звук, шум, перебиванияДообучение на размеченных реальных звонках
Доменная лексика (банк, логистика, клиника)Термины путаются и «выравниваются» под общие словаСловарь терминов и разметка отраслевых диалогов
Переключение «узбекский ↔ русский»Фраза теряется на стыке языковОтдельная обработка кодовых переключений
Задержка до ответаОжидание конца фразы даёт слышимую паузуСтриминговое распознавание вместо пакетного

Вывод для тех, кто выбирает голосового вендора

Спрашивайте не «какая у вас модель», а «на каких данных она доучена под наш язык и нашу отрасль» и «какая задержка на телефонном канале». Для банков СНГ это и есть два решающих вопроса. Точные цифры по вашему контуру подтверждаются на демо.

Частые вопросы

Почему распознавание узбекской речи сложнее, чем русской

Данных для обучения меньше, а речь живая: сильные акценты, диалектные различия и переключение на русский в середине фразы. Добавьте телефонный канал со сжатым звуком и шумом — и универсальная модель, которая хорошо звучит на студийной записи, начинает терять слова.

Что даёт замена модели на более крупную

Меньше, чем ожидают. Крупная модель поднимает общее качество, но не знает вашу отраслевую лексику и добавляет задержку. Точность на доменных словах даёт дообучение на размеченных реальных звонках и словарь терминов, а не размер модели сам по себе.

Какая задержка допустима в голосовом диалоге

Ориентир простой: человек не должен чувствовать паузу после того, как договорил. Поэтому считают не время работы модели, а весь путь — распознавание, понимание, ответ и синтез. Стриминговое распознавание убирает самый заметный кусок ожидания.

Как AI справляется со смешанной узбекско-русской речью

Кодовые переключения обрабатываются отдельно: система не заставляет говорящего держаться одного языка, а распознаёт стык и продолжает фразу. Без такой обработки модель теряет вторую половину предложения — именно там чаще всего звучат цифры, суммы и названия услуг.

Что спросить у вендора голосового AI перед пилотом

Три вещи: на каких данных модель доучена под ваш язык и отрасль, какая задержка именно на телефонном канале и что происходит при нетиповом запросе. Просите проверку на ваших записях — точные цифры по контуру подтверждаются на демо, а не в презентации.

Нужны ли собственные модели или достаточно готовых

Зависит от сегмента. Малому и среднему бизнесу обычно хватает готовых моделей с настройкой под каталог и сценарий. Для enterprise с требованиями по данным и контуру речевой стек разворачивается отдельно, и объём работ обсуждается на этапе внедрения — до 30 дней.

ДЕМО

Запустите AI-сотрудника на своих каналах

Соберём демо на ваших реальных диалогах из Instagram, Telegram и телефонии — увидите результат на своих цифрах. Запуск для SMB — от 2 часов.

Узбекский, русский и английский. Подключается к вашим каналам и системам.