Qwen3.8-Max 正式发布:上次挤牙膏没给的基准分,这次全补齐了
2026 年 8 月 3 日,阿里巴巴通义千问团队正式发布 Qwen3.8-Max,并同步上线配套的 Agent 产品"千问办公"。这次发布补上了半个月前留下的一个大坑——本站在 7 月 20 日《Qwen3.8 深度解读:2.4 万亿参数、"第二只服 Fable 5",但一个基准分都没给》一文中提到,阿里当时只在 X 上甩出一句"我们相信它是当今最强大的模型之一,仅次于 Fable 5",却没有附带任何技术报告、跑分数据,连每 token 的激活参数量都没披露。
半个月后,这个悬念有了完整答案:Arena 综合榜排名、Vision Arena 与 CodeArena 的具体名次、PaperBench 编程评测分数、真实办公场景的实测效果、国际与国内两套定价,以及一个此前从未出现过的承诺——Qwen-Max 级别的旗舰模型,历史上第一次要开放权重。这也是为什么在过去 24 小时的 AI 圈新闻里,这条比"又一个模型刷榜"更值得深入写一写:它不只是一次模型发布,更标志着中国大模型阵营在"闭源旗舰要不要开源"这个问题上又往前迈了一步。
信息来源:阿里云通义千问官方发布、量子位《阿里 Qwen3.8 正式发布,编程与办公再进化,推理更快更稳定》、DataLearnerAI《Qwen3.8-Max:评测、价格、API 与模型参数》、Dataconomy 中文版《阿里巴巴开源 Qwen3.8-Max 人工智能模型》、凤凰网科技《阿里 Qwen3.8-Max 模型发布:2.4 万亿参数,瞄准复杂长程任务》等公开报道整理,文末附完整链接。
一、背景介绍:从"预告没数据"到"正式发布带齐数据"
把时间线拉直看会更清楚阿里这半个月在做什么:
- 7 月 16 日:Moonshot AI 发布 2.8 万亿参数的 Kimi K3(本站 7 月 18 日已详细拆解),中国开源阵营的参数量竞赛进入新阶段。
- 7 月 19 日:阿里在 X 上抢发一条不到 100 字的预告推文,甩出 Qwen3.8 的名字和"2.4T 参数、仅次于 Fable 5"的定位宣言,但没有技术报告、没有跑分、没有架构细节,更像是一次"占坑"式的应激反应。
- 8 月 3 日:阿里正式发布 Qwen3.8-Max,这次不再是一句话公告,而是完整的技术细节、第三方榜单排名、真实业务场景实测和明确的开源时间表。
这个"先用一句话占住话题、半个月后再补全数据"的打法,本身也值得开发者留意——在当下这种几乎"隔天刷新参数纪录"的行业节奏里,厂商越来越倾向于先抢占叙事窗口,再慢慢把证据链补齐。这次阿里补上的证据链,含金量确实不低。
二、技术细节解析
2.1 架构与规模
Qwen3.8-Max 基于 Qwen 3.5 架构演进而来,核心参数:
| 项目 | 数值 |
|---|---|
| 总参数量 | 2.4 万亿(2.4T) |
| 激活参数量 | 950 亿(95B) |
| 架构 | 稀疏 MoE + 混合注意力机制 |
| 上下文长度 | 约 1M tokens |
| 最大输出 | 128K tokens |
| 模态 | 文本 / 图像 / 视频 → 文本 |
| 推理模式 | 强制思考模式,分低 / 高 / 超高三档强度 |
值得注意的两点:第一,950 亿激活参数意味着这是一个典型的"大稀疏、小激活"MoE 设计思路,和 Kimi K3、DeepSeek-V4 系列的技术路线一致,用远小于总参数量的实际计算量换取接近满血模型的效果;第二,"强制思考模式"是个明确的产品选择——Qwen3.8-Max 不提供关闭思考链的选项,三档强度(低/高/超高)由调用方按任务复杂度自行选择,这和 Claude、GPT 系列"可选思考"的设计不同,说明阿里判断在当前阶段,测试时计算(test-time compute)对这个模型的能力上限影响太大,不值得为了省 token 而关闭。
2.2 榜单表现
在权威第三方 Arena 综合榜单上,Qwen3.8-Max 仅次于 Anthropic 的 Claude 系列,是当前全球大模型第一梯队的成员之一。细分榜单:
- Vision Arena:全球第二
- CodeArena:全球第四
- PaperBench 编程评测:93.0 分,较上一代提升 28.2 分,创下评测新高
PaperBench 这个 28.2 分的提升幅度值得单独说一句——这是一个衡量模型复现学术论文实验、完成研究工程任务能力的评测集,单次迭代能拉开这么大的差距,说明阿里这一代在"长程自主执行"上做了针对性优化,而不只是常规的规模堆叠。
2.3 长程自主能力的实测场景
阿里这次公布了几个具体到"能验证"程度的实测案例,比单纯秀跑分更有说服力:
- 自主编程:从一个空文件夹出发,无人工干预连续运行 16 天,完成开源项目
oh-my-cli的构建,累计产生 265 次代码提交。 - 自主科研:连续自主工作 125 小时,在 AIME24 数学基准上取得 2.7 分的提升。
- 竞赛表现:24 小时内在某场公开竞赛中击败 458 支人类参赛队伍。
- 法律场景:处理数百份法律文件、标出 1,284 条条款,耗时从人工的一周压缩到一小时。
- 芯片设计:通过约 500 轮交互,将某电路设计的门数从 8,298 门优化到 678 门。
- 电商模拟:在 365 天的长周期经营模拟测试中,取得 416,252 元的资金成绩。
- 体育数据分析:原本需要数十小时的分析工作缩短到数十分钟。
这几个场景共同指向一个信号:阿里这次发布刻意把重点从"单点跑分"转向"长时间跨度、无人值守的真实任务交付能力",这和本站 8 月 3 日介绍的 OpenAI Astra(协调多智能体长时间共同解决数学难题)呈现出相似的行业趋势——测试时计算和长程自主执行,正在取代单纯的参数规模,成为 2026 年下半年各家模型竞争的主战场。
2.4 多模态与配套生态
Qwen3.8-Max 支持文本、图像、视频输入,配套推出了 Qwen-MM-Plugins 插件库,支持 GUI 交互与视觉反馈,可以理解为面向"看屏幕操作软件"这类 Agent 场景的能力补充。同步上线的 Agent 产品"千问办公"(Qwen Cowork)已经接入 Qwen3.8 API,定位类似 OpenAI 的 Operator 或 Anthropic 的 Computer Use,主打专业办公场景的自动化。
三、定价与开源计划:这次是真的"卷"到位了
3.1 API 定价
| 计费项 | 国内价格 | 国际价格 |
|---|---|---|
| 输入 | ¥12 / 百万 tokens | $2 / 百万 tokens |
| 输出 | ¥36 / 百万 tokens | $6 / 百万 tokens |
| 隐式缓存命中 | ¥1.5 / 百万 tokens | — |
按公开报道的说法,国际输入/输出价格分别只有 Claude Opus 5 的约 40% 和 24%,在"仅次于 Claude"的榜单定位下打出这样的价格,对预算敏感、又需要旗舰级能力的开发者是个明显的信号。
3.2 开源计划
这是本次发布里最值得记一笔的部分:阿里宣布 Qwen3.8-Max 的权重预计将于下周开源,同时还会开源规模更小的 Qwen3.8-27B。此前 Qwen-Max 系列一直是纯闭源、只提供 API 的旗舰产品线(对标 GPT-5.x/Claude Opus 系列),Qwen 的开源权重版本通常止步于 Qwen-Plus 或更小的尺寸。如果 Qwen3.8-Max 的权重如期开源,将是 Qwen-Max 级别模型历史上第一次真正开放权重,也会进一步印证此前"中国开源模型累计下载量占全球 41%、落后闭源前沿仅约 4 个月"的行业判断。
四、实践指南:如何接入 Qwen3.8-Max
Qwen3.8 目前已在千问 AI 平台开放 API,接口与 OpenAI SDK 兼容,开发者可以直接复用现有工具链,只需切换 base_url 和模型名。以下是一个 Python 调用示例(含思考强度参数):
from openai import OpenAI
client = OpenAI(
api_key="你的 DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "system", "content": "你是一名严谨的后端架构师。"},
{
"role": "user",
"content": "帮我审查这段 Python 代码是否存在并发安全问题,并给出修复建议。",
},
],
extra_body={
# 思考强度:low / high / extra-high,Qwen3.8-Max 不支持关闭思考模式
"thinking_intensity": "high",
},
max_tokens=4096,
)
print(response.choices[0].message.content)2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
几点接入时需要注意的细节:
- 思考模式不可关闭——如果你的应用场景是低延迟的简单问答,
thinking_intensity设为low也仍然会产生思考开销,成本和延迟评估时要把这一点算进去,不能直接套用 Claude/GPT 那种"可选思考"的成本模型。 - 长上下文场景注意分段计费——1M tokens 的上下文窗口配合隐式缓存(¥1.5/百万 tokens)非常适合"长文档反复追问"的场景,比如法律文书审查、长代码库问答,命中缓存的部分成本能降到输入价的八分之一。
- 多模态输入走同一个 endpoint——图像/视频输入通过标准的
content数组传入image_url/video_url字段即可,无需切换到专门的多模态接口,这点与 Qwen 系列一贯的 API 设计习惯一致。 - 等开源权重发布后本地部署——如果不想依赖云端 API,可以关注下周 Qwen3.8-Max 与 Qwen3.8-27B 的权重发布,27B 这个尺寸对个人开发者和中小团队的本地推理更友好,2.4T 满血版则需要多机多卡集群才能承载。
五、总结与展望
从 7 月 19 日一条没有数据支撑的预告推文,到 8 月 3 日带着完整榜单、真实场景实测和开源承诺的正式发布,Qwen3.8-Max 用半个月时间证明了"仅次于 Fable 5"不完全是空话——至少在 Arena 综合榜和 Vision Arena 上,它确实站到了除 Claude 系列之外的第一梯队位置。更值得关注的是两个信号:
第一,长程自主执行能力正在取代单点跑分成为新的竞争焦点。16 天无人工干预的自主编程、125 小时连续自主科研工作,这些场景和 8 月 3 日本站介绍的 OpenAI Astra 数学证明工作呈现出一致的行业方向——模型厂商不再满足于"一次问答给出正确答案",而是在比拼"放手让模型自己跑多久、能不能扛住多长的任务链条"。
第二,Qwen-Max 级别旗舰模型即将开放权重,如果下周如期兑现,将是国产大模型开源阵营的一个标志性节点。这意味着开发者未来有机会在本地或私有云上部署一个"仅次于 Claude"性能水平的模型,而不必依赖任何厂商的 API——这对数据敏感行业(法律、金融、医疗)和希望摆脱 API 定价波动风险的团队,都是实打实的利好。接下来一周,值得持续关注权重是否如期放出、社区跑分是否能验证官方宣称的榜单排名,以及 Qwen3.8-27B 这个更适合本地部署的尺寸实际表现如何。
参考来源:
💬 评论