Инженерия

Распознавание узбекской речи в production: что работает из коробки, а что пришлось дотягивать

Голосовой AI на узбекском упирается не в модель, а в данные и латентность. Разбираем, где теряются миллисекунды и точность — и как мы их вернули.

Инженерная командаML и инфраструктура Zukko.AI17 июня 2026 г.9 мин чтения
ASR · LATENCY

Голосовой агент для контакт-центра — это не «модель, которая обзванивает». Это конвейер: распознавание речи, понимание запроса, ответ и синтез — и всё это должно укладываться в задержку, при которой человек не чувствует паузы. На узбекском языке узкое место — именно распознавание: акценты, переключение на русский в середине фразы, банковская терминология.

Что работает из коробки

Базовая модель неплохо берёт чистую студийную речь и стандартные фразы. Для FAQ-сценариев — «остаток по карте», «часы работы», «адрес отделения» — этого почти достаточно. Проблемы начинаются на телефонном канале: сжатый звук, шум, перебивания.

Что пришлось дотягивать

Точность на доменной лексике мы поднимали не сменой модели, а данными: размеченные реальные звонки, словарь терминов, обработка кодовых переключений «узбекский ↔ русский». Отдельно боролись за латентность — стриминговое распознавание вместо ожидания конца фразы убирает самую заметную паузу.

В голосовом AI выигрывает не самая большая модель, а самый короткий и предсказуемый путь от звука до ответа.

Вывод для тех, кто выбирает голосового вендора

Спрашивайте не «какая у вас модель», а «на каких данных она доучена под наш язык и нашу отрасль» и «какая задержка на телефонном канале». Для банков СНГ это и есть два решающих вопроса. Точные цифры по вашему контуру подтверждаются на демо.

ДЕМО

Запустите AI-сотрудника на своих каналах

Соберём демо на ваших реальных диалогах из Instagram, Telegram и телефонии — увидите результат на своих цифрах. Запуск для SMB — от 2 часов.

Узбекский, русский и английский. Подключается к вашим каналам и системам.