-
Добавлено пользователем arturbaranok - 29.07.2026 - 12:13
Компании OpenAI и Alibaba одновременно анонсировали новые модели искусственного интеллекта для работы с голосом. Решения ориентированы на разные сценарии использования: OpenAI сосредоточилась на преобразовании речи в текст, а Alibaba — на голосовом взаимодействии в режиме реального времени.
OpenAI представила GPT-Live-Transcribe и GPT-Transcribe
OpenAI выпустила две новые модели:
- GPT-Live-Transcribe — для распознавания речи с минимальной задержкой в режиме реального времени;
- GPT-Transcribe — для обработки уже записанных аудиофайлов и пакетного асинхронного распознавания.
Обе модели получили поддержку передачи дополнительного контекста. Теперь пользователи могут указывать ключевые слова, имена, специализированные термины и предполагаемые языки записи, что позволяет повысить точность распознавания.
Кроме того, GPT-Live-Transcribe умеет автоматически использовать ранее распознанные фрагменты разговора в качестве контекста для последующей обработки.
Точность распознавания заметно выросла
По данным OpenAI, на внутреннем тесте Context Aware ASR использование дополнительного контекста повысило семантическую точность:
- для GPT-Live-Transcribe — с 38,5% до 44,6%;
- для GPT-Transcribe — с 41,6% до 45,2%.
В отдельном тестировании на реальных аудиозаписях GPT-Live-Transcribe продемонстрировала уровень ошибок транскрипции 9,60%, тогда как у GPT-Realtime-Whisper этот показатель составил 11,65%.
Модель GPT-Transcribe достигла 8,98% ошибок транскрипции, улучшив результат по сравнению с Whisper-1, у которого показатель равен 15,21%.
Независимая аналитическая компания Artificial Analysis также протестировала GPT-Transcribe. По ее данным, модель показала уровень ошибок по словам (Word Error Rate) 3,31%, что превосходит предыдущие решения OpenAI. Стоимость использования модели составляет 4,5 доллара за 1000 минут обработки аудио.
Alibaba выпустила Qwen-Audio 3.0 Realtime Plus и Flash
Alibaba представила модели Qwen-Audio 3.0 Realtime Plus и Qwen-Audio 3.0 Realtime Flash, предназначенные для голосового общения без промежуточного преобразования речи в текст.
Новые модели поддерживают двусторонний полноскоростной диалог (full-duplex), благодаря чему пользователь может перебивать искусственный интеллект во время разговора. Также реализованы поддержка вызова функций (Function Calling) и использование пользовательских клонированных голосов.
Модель Alibaba возглавила независимый рейтинг
Согласно данным Artificial Analysis Speech-to-Speech Index, Qwen-Audio 3.0 Realtime Plus заняла первое место с результатом 84,1%, опередив GPT-Realtime-2.1 High от OpenAI, набравшую 79,1%.
Модель Alibaba получила лучшие оценки в тестах на способность рассуждать во время голосового общения, качество ведения диалога и выполнение агентских задач.
При этом исследование выявило и недостаток новой разработки. Qwen-Audio 3.0 Realtime Plus начинает отвечать заметно медленнее конкурента. По данным Artificial Analysis, время до начала воспроизведения первого аудио составляет около четырех секунд, тогда как GPT-Realtime-2 High начинает формировать ответ примерно через 1,14 секунды.