8月3日,阿里巴巴千问(Qwen)团队正式推出千问3.8-Max。这款模型总参数量高达2.4万亿,激活参数为95B,不仅是千问家族目前规模最大、能力最强的成员,也是该系列首次将Max级别模型开源。其权重文件计划于下周在Hugging Face和ModelScope这两个开源社区同步开放下载。

在定价策略上,千问3.8-Max通过阿里云旗下的千问AI平台提供API调用服务:输入端收费2.0美元/百万tokens,输出端6.0美元/百万tokens,隐式缓存费用则为0.25美元/百万tokens。

基准测试结果显示,千问3.8-Max在编程智能体及通用智能体的多项指标上,表现与Anthropic Fable5相当,甚至在部分维度实现超越。具体来看,PaperBench得分93.0,高于Fable5的88.8;CoWorkBench得分为74.8,与Fable5的75.9基本持平;WideSearch得分81.9,同样与Fable5的81.2不相上下。

**性能表现:比肩 Fable 5,局部领先**

依据千问团队公布的完整基准数据,Qwen3.8-Max在多个核心指标上要么与Anthropic Claude Fable 5持平,要么超出其成绩。

多模态领域同样亮点纷呈。需注意的是,Fable 5的部分结果可能涉及回退机制,千问团队已在注释中对此进行了说明。

**编程实战:从空文件夹到生产级交付**

为了验证千问3.8-Max的自主编程实力,千问团队选取了三个真实案例进行测试,全程无需人工介入。

案例一聚焦于十天级的自动编程任务。模型从零开始构建oh-my-cli项目,自主运行约16天,期间累计完成265次commits、提交127个PR并处理151个issues。该过程将用户反馈、社区最佳实践与自测结果统一纳入工程循环,实现了从需求自动领取、代码生成到测试验证的完整闭环。

案例二旨在复现并超越学术论文。模型独立工作约125小时,编写代码约7,600行,执行超过1,100步操作,并完成33轮GPU训练,成功复现论文《Unified Data Selection for LLM Reasoning》中的六项主要结论。随后进入“自我进化”阶段,模型提出并测试了18种改进方案,最终在竞赛级数学基准AIME24上,较论文原方法再提升2.7分。

案例三中,模型参加WWW2025多模态对话意图识别挑战赛,在526支人类队伍中脱颖而出。经过45次提交迭代,准确率由0.60提升至0.853,成功击败458支队伍,胜率高达87%。

**办公与长程任务:数百职业场景的生产级验证**

千问团队在数百种高价值职业场景中,对千问3.8-Max的实际交付能力进行了广泛测试。

在E-Commerce Bench(365天电商经营模拟基准)中,千问3.8-Max以¥416,252的收益胜出,回报倍数达4.16倍。这一成绩超过第二名GLM 5.2的38%,相比上一代千问3.7-Max提升了152%。

**芯片设计:500轮交互,面积缩减81%**

在芯片设计优化任务中,千问3.8-Max展现了长程自主规划能力。

任务目标是优化一个G CD/RSA密码硬件加速器的逻辑门数量。在无参考设计、无人工干预的条件下,模型历经约500轮交互、71次评估,跨越13个关键里程碑,将初始设计的8,298门优化至678门,在所有参评模型中表现最优。

在物理实现层面,芯片面积从106×106 µm²收缩至46×46 µm²,布线长度从33,369 µm降至4,187 µm,并在500 MHz频率下实现时序闭合,整体芯片面积缩减81%。

**多模态能力:视觉贯穿执行全流程**

千问3.8-Max的视觉能力超越了单纯的“看懂图片”,而是作为持续反馈回路贯穿整个任务执行过程。

在执行过程中,模型会持续观察中间产物——检查页面布局、物体方向、动画效果等,一旦发现偏差便自主定位并修正。千问团队将此定义为“原生视觉反馈回路”。

基准测试方面,千问3.8-Max在OSWorld-Verified得分86.1,超过Fable5的85.0;AndroidWorld得分85.3,接近Fable5的88.8;ParametricCAD Bench得分91.5,优于Fable5的87.5。

为方便开发者接入,千问团队同步推出了千问-MM-Plugins,为不同智能体框架提供图像与视频处理、多模态记忆、视觉工具调用等扩展支持。

**开放接入:兼容 Claude Code、Codex 等主流框架**

目前,千问3.8-Max已通过千问AI平台提供API服务,支持OpenAI兼容协议和Anthropic兼容协议,可直接集成Claude Code、Codex、Qoder CLI、千问 Code、OpenClaw等主流开发工具。

API支持reasoning_effort参数以调节推理深度:xhigh(默认设置,适合复杂任务)、medium(平衡准确性与速度)、low(侧重速度与成本优化)。

此外,模型权重将于下周在Hugging Face和ModelScope开源,届时千问3.8-27B也将同步上线。