Перейти к основному содержанию
Alibaba представила Qwen3.8-Max — флагманскую AI-модель с 2,4 трлн параметров

Alibaba представила Qwen3.8-Max — флагманскую AI-модель с 2,4 трлн параметров

Alibaba официально представила Qwen3.8-Max — крупнейшую и наиболее производительную модель искусственного интеллекта в линейке компании. Новинка уже доступна через сервис QwenCloud, а веса модели с открытым доступом планируется опубликовать на платформах Hugging Face и ModelScope на следующей неделе.

Alibaba представила Qwen3.8-Max — флагманскую AI-модель с 2,4 трлн параметров

Qwen3.8-Max построена на архитектуре Mixture-of-Experts (MoE) и содержит 2,4 трлн параметров. При этом во время обработки каждого запроса активируются 95 млрд параметров, что, по данным Alibaba, позволяет сохранить высокую производительность при снижении затрат на инференс и сокращении времени отклика.

Модель является мультимодальной и способна работать с текстом, изображениями и видео. Она также поддерживает контекстное окно объемом до 1 млн токенов.

Модель рассчитана на длительную автономную работу

В официальном блоге Alibaba сообщила, что Qwen3.8-Max способна непрерывно выполнять задачи по разработке программного обеспечения более 10 дней. В качестве примера компания привела внутренний проект по программной инженерии, который модель, как утверждается, завершила за 16 дней.

В связи с этим Alibaba позиционирует Qwen3.8-Max прежде всего для задач программирования и совместной работы, где AI-агент должен длительное время самостоятельно выполнять поставленные задачи.

Alibaba заявила о преимуществах в тестах

По данным компании, Qwen3.8-Max превосходит Claude Fable 5 и GPT-5.6 Sol в ряде независимых бенчмарков.

В тестах, оценивающих возможности программирования, работу AI-агентов и общие способности модели, новинка показала лучшие результаты в семи различных оценках.

В мультимодальных и визуальных тестах Alibaba заявляет о лидерстве Qwen3.8-Max в 36 различных бенчмарках по сравнению с GPT-5.6 Sol и Claude Fable 5.

Среди тестов, в которых опубликованы результаты новой модели, — Terminal Bench 2.1, PaperBench, CoWorkBench, IFBench, HealthBench, PLawBench, MMMU-Pro, LogicVista, OSWorld-Verified, AndroidWorld, OmniDocBench 1.5, OCR-Bench-V2, RealWorldQA, Dense200, VideoMME, VideoMMMU и многие другие.

Полная таблица результатов тестирования:

 Opus4.8Fable5GPT5.6 Sol (max)Qwen3.7-MaxQwen3.8-Max
Кодинг агент
Terminal Bench 2.184.684.688.874.586.6
SWE-bench Pro69.280.064.660.667.7
DeepSWE 1.159.070.073.021.656.6
NL2Repo-Bench69.4----47.255.9
FrontierSWE70.088.8--40.773.5
MLS-Bench-Lite42.849.946.231.741.0
PaperBench80.388.890.564.893.0
AndroidBench69.884.574.056.570.2
QwenSWEBench84.086.373.563.480.7
QwenQoderBench62.763.153.836.858.4
QwenReactBench16941770156415381724
QwenSVGBench16481690175814991713
Основной агент
CoWorkBench72.375.971.564.674.8
WorkSpaceBench66.868.765.661.467.7
JobBench48.457.445.431.353.4
SkillsBench65.170.973.561.270.2
Agents' Last Exam (Pass / Score)27.0 / 45.1-- / --30.6 / 53.611.8 / 31.127.0 / 52.4
Automation-Bench (Pass@1)27.229.129.714.227.3
Toolathlon Verified (Pass@1)76.277.974.949.772.5
WideSearch72.981.2--75.281.9
HLE w/ tools57.964.558.053.556.2
Общие возможности
GPQA Diamond92.092.694.192.492.6
HLE45.753.347.241.443.6
IFBench62.263.572.779.182.8
$OneMillion-Bench (expert score)41.855.953.844.452.5
HealthBench52.4--55.354.560.2
PLawBench69.670.272.358.973.2
PRBench-Legal52.757.657.648.557.6
PRBench-Finance51.955.855.546.858.3
MRCR v2 256K (8-needle)83.2--93.886.792.9
LongBench v269.1--67.165.366.3

Таблица мультимодальных бенчмарков:

 Opus4.8Fable5Gemini3.1-ProGPT5.6-SolQwen3.7-PlusQwen3.8-Max
Мультимодальное рассуждение
MMMU-Pro75.681.280.583.079.082.3
MathVision87.1 / 97.192.7 / 98.687.4 / 95.790.8 / 97.890.3 / --95.2 / 97.7
BabyVision28.4 / 81.242.5 / 90.555.9 / 68.365.5 / 88.964.7 / 70.482.0 / 91.3
HLE-VL (w/ Tools)----43.951.225.652.2
ZeroBench (Pass@5)17.0 / 34.020.0 / 46.017.0 / 23.022.0 / 35.019.0 / 19.024.0 / 49.0
ZeroBench-Sub31.137.136.546.741.048.5
LogicVista76.785.782.689.784.391.9
HiPhO69.378.685.486.884.190.0
PhyX54.271.779.479.180.083.5
SLAKE75.986.682.985.183.290.8
MedXpertQA-MM71.780.080.781.571.080.4
PMC-VQA59.263.262.562.363.466.2
Визуальный агент и программирование
OSWorld-Verified83.485.076.283.273.386.1
OSWorld 2.020.6 / 54.8-- / 66.17.8 / 30.6-- / 62.62.8 / 21.519.4 / 46.7
ScreenSpot Pro82.387.368.181.379.084.5
WebArena-Verified67.971.364.369.755.366.8
AndroidWorld75.088.870.777.681.085.3
MobileWorld67.585.558.176.951.277.8
ClawEval-MM73.3 / 73.881.2 / 77.550.5 / 55.281.2 / 78.957.4 / 60.177.2 / 74.8
Vision2Web62.470.5--62.142.169.0
QwenBlenderBench62.469.523.068.641.569.9
Parametric CAD Bench85.187.573.586.273.891.5
RecreationBench48.056.116.247.630.251.7
PresentBench80.979.855.482.965.779.6
Интеллектуальные технологии обработки документов и офисных процессов
CharXiv (RQ)78.5 / 89.987.9 / 93.584.4 / 89.985.1 / 89.185.8 / 85.988.4 / 93.5
OmniDocBench 1.586.589.590.086.791.492.1
OCR-Bench-V2 (EN/ZH)53.9 / 55.365.3 / 58.164.6 / 58.269.0 / 57.370.7 / 67.174.2 / 68.3
CC-OCR-Bench-V260.372.468.968.072.779.6
MTVQA-Test48.141.654.352.751.256.6
MADQA86.886.081.187.887.191.8
QwenVisualOffice34.532.439.629.532.444.6
Понимание реального мира и пространственное понимание
RealWorldQA76.685.983.583.786.988.0
ERQA57.270.068.070.069.877.8
LingoQA73.877.466.872.683.484.8
SURDS62.279.464.063.077.277.8
Зрительное восприятие и привязка к реальности
SimpleVQA67.373.473.166.670.375.0
WorldVQA33.953.554.045.143.953.2
MMStar76.780.584.082.583.285.9
PerceptionBench47.257.256.259.751.163.5
CountQA41.363.172.868.677.082.4
RefAdv-S61.768.671.969.273.080.2
Dense20020.831.169.755.360.787.0
COCO50.756.472.461.274.278.7
VisFactor30.154.539.862.842.860.8
VLMsAreBiased43.861.274.159.836.688.3
Видеоаналитика и агенты
VideoMME (w/ Sub.)85.4--86.789.588.090.4
VideoMME v2 (w/ Sub.)49.052.266.971.159.768.3
VideoMMMU75.381.285.385.085.488.7
MMVU67.472.077.981.276.682.4
MLVU (M-Avg)53.4--84.787.687.490.8
TVBench61.5--73.083.278.281.9
LVBench67.3--75.178.876.281.8
LVBench (w/ Mem.)84.390.1--84.274.585.6
EgoLife (w/ Mem.)78.382.3--70.868.880.3
VideoDR (w/ Search)65.677.1--71.341.073.2

Конкуренция между китайскими и американскими разработчиками усиливается

Выход Qwen3.8-Max продолжает тенденцию быстрого развития китайских AI-компаний.

Недавно Moonshot AI представила мультимодальную модель Kimi K3 с 2,8 трлн параметров и открытыми весами, ориентированную на конкуренцию с решениями OpenAI и Anthropic.

Кроме того, на прошлой неделе DeepSeek выпустила DeepSeek-V4-Flash, заявив о значительном улучшении возможностей в программировании и работе AI-агентов при более низкой стоимости по сравнению с американскими аналогами.

Alibaba считает, что публикация Qwen3.8-Max станет еще одним шагом в усилении конкуренции между китайскими и американскими разработчиками больших языковых моделей. Компания уже открыла доступ к модели через QwenCloud, а публикация ее весов в открытом доступе ожидается в ближайшие дни.