Перейти к основному содержанию
OpenAI и Alibaba представили новые голосовые ИИ-модели для распознавания речи и общения в реальном времени

OpenAI и Alibaba представили новые голосовые ИИ-модели для распознавания речи и общения в реальном времени

Компании OpenAI и Alibaba одновременно анонсировали новые модели искусственного интеллекта для работы с голосом. Решения ориентированы на разные сценарии использования: OpenAI сосредоточилась на преобразовании речи в текст, а Alibaba — на голосовом взаимодействии в режиме реального времени.

OpenAI и Alibaba представили новые голосовые ИИ-модели для распознавания речи и общения в реальном времени

OpenAI представила GPT-Live-Transcribe и GPT-Transcribe

OpenAI выпустила две новые модели:

  • GPT-Live-Transcribe — для распознавания речи с минимальной задержкой в режиме реального времени;
  • GPT-Transcribe — для обработки уже записанных аудиофайлов и пакетного асинхронного распознавания.

Обе модели получили поддержку передачи дополнительного контекста. Теперь пользователи могут указывать ключевые слова, имена, специализированные термины и предполагаемые языки записи, что позволяет повысить точность распознавания.

Кроме того, GPT-Live-Transcribe умеет автоматически использовать ранее распознанные фрагменты разговора в качестве контекста для последующей обработки.

Точность распознавания заметно выросла

По данным OpenAI, на внутреннем тесте Context Aware ASR использование дополнительного контекста повысило семантическую точность:

  • для GPT-Live-Transcribe — с 38,5% до 44,6%;
  • для GPT-Transcribe — с 41,6% до 45,2%.

В отдельном тестировании на реальных аудиозаписях GPT-Live-Transcribe продемонстрировала уровень ошибок транскрипции 9,60%, тогда как у GPT-Realtime-Whisper этот показатель составил 11,65%.

Модель GPT-Transcribe достигла 8,98% ошибок транскрипции, улучшив результат по сравнению с Whisper-1, у которого показатель равен 15,21%.

Независимая аналитическая компания Artificial Analysis также протестировала GPT-Transcribe. По ее данным, модель показала уровень ошибок по словам (Word Error Rate) 3,31%, что превосходит предыдущие решения OpenAI. Стоимость использования модели составляет 4,5 доллара за 1000 минут обработки аудио.

Alibaba выпустила Qwen-Audio 3.0 Realtime Plus и Flash

Alibaba представила модели Qwen-Audio 3.0 Realtime Plus и Qwen-Audio 3.0 Realtime Flash, предназначенные для голосового общения без промежуточного преобразования речи в текст.

Новые модели поддерживают двусторонний полноскоростной диалог (full-duplex), благодаря чему пользователь может перебивать искусственный интеллект во время разговора. Также реализованы поддержка вызова функций (Function Calling) и использование пользовательских клонированных голосов.

Модель Alibaba возглавила независимый рейтинг

Согласно данным Artificial Analysis Speech-to-Speech Index, Qwen-Audio 3.0 Realtime Plus заняла первое место с результатом 84,1%, опередив GPT-Realtime-2.1 High от OpenAI, набравшую 79,1%.

Модель Alibaba получила лучшие оценки в тестах на способность рассуждать во время голосового общения, качество ведения диалога и выполнение агентских задач.

При этом исследование выявило и недостаток новой разработки. Qwen-Audio 3.0 Realtime Plus начинает отвечать заметно медленнее конкурента. По данным Artificial Analysis, время до начала воспроизведения первого аудио составляет около четырех секунд, тогда как GPT-Realtime-2 High начинает формировать ответ примерно через 1,14 секунды.