GLM-5.3 发布:编程能力暴涨 50%,却因"意外挖出"上千个高危漏洞而推迟开源权重
2026 年 8 月 14 日,中国 AI 公司 Z.ai(智谱旗下面向全球市场的品牌)正式发布新一代大模型 GLM-5.3,主打编程与 Agent 场景。这次发布最值得记录的不是又一次基准分数的刷新,而是一个此前在主流开源模型阵营里从未公开出现过的场景:模型的网络安全能力在训练过程中"长得比预期快",团队在真实世界测试里让它审计了 269 个开源项目,结果挖出 2436 个漏洞,其中 1097 个被判定为高危或严重级别——包括一个存在了近四十年的老代码缺陷。面对这样的结果,Z.ai 选择把原本计划同步开源的模型权重推迟两周,用于额外的安全加固和风险评估。这是目前已知第一家因为"涌现出的网络安全能力"而不是笼统安全条款主动暂缓开源权重发布的主力开源模型厂商,值得开发者和安全从业者认真关注。
一、背景:为什么这次发布不只是又一次"分数刷新"
把时间线拉长看,2026 年 8 月已经是大模型安全议题密集爆发的一个月:8 月 11 日 OpenAI 因 Astra 模型的网络安全能力可能触及 Preparedness Framework 的"Critical"红线而暂停发布(本站此前已有专文分析);8 月 13 日 Google 发布 Gemini 3.7 Flash,聚焦编程与 Agent 场景效率与价格的双重优化;几乎同一时间窗口内,OpenAI 的 GPT-5.6-Cyber 也成为其 Preparedness Framework 下首个触及"High"网络安全能力门槛的模型。GLM-5.3 的发布正好接在这条时间线上,而且它是一个开源(权重即将公开)模型——这意味着"网络安全能力可能失控"这个此前主要发生在闭源前沿模型身上的问题,第一次真实地摆在了开源生态面前:一旦权重公开,全世界任何人都能拿到一个"擅长自动挖漏洞、甚至能推理出多阶段利用链"的模型本地跑起来,责任和风险的边界该怎么划,是一个全新的行业课题。
Z.ai 这次给出的应对方式颇具代表性:不是取消开源承诺,也不是简单地打上安全免责声明,而是实打实地把权重发布往后推了大约两周,用来做额外的安全评估和防护加固,这个决策本身传递出的信号,可能比 GLM-5.3 的编程分数更值得行业记住。
二、技术细节解析
1. 架构与规模:不换基座,靠后训练"榨"出性能
GLM-5.3 延续了 GLM-5.2 的混合专家(MoE)架构,多份信源给出的总参数规模在 7440 亿到 7530 亿之间(不同报道口径略有差异,官方尚未针对 5.3 单独公布精确数字),支持 100 万 token 的上下文窗口。关键在于:这一代没有重新训练新的基座模型,Z.ai 官方将所有能力提升归因于"后训练阶段的极限规模化"(extreme scaling in the post-training stage)——具体做法是大幅扩展任务环境的数量与多样性,并显著拉长后训练时长。这和 Gemini 3.7 Flash "算法层面优化推理基础"的路径有相似之处:2026 年下半年以来,头部厂商越来越倾向于在同一个基座上通过后训练/强化学习去"压榨"性能,而不是每次都重炼一个更大的预训练模型,这背后既是成本考量,也说明后训练环节的性价比正变得越来越高。
训练方法上,Z.ai 使用了自研的 Agent 去构造贴近真实开发者工作站的模拟环境和定制化编程挑战题,并结合开源的 slime 训练框架与团队提出的 SAO(一种强化学习方法)来加速异步强化学习训练效率,这套组合是 GLM-5.3 编程能力大幅跃升的核心工程支撑。
2. 关键基准:编程能力跃升,但网络安全能力"意外"更抢眼
官方与第三方评测给出的 GLM-5.3 对比 GLM-5.2 的关键数据:
| 基准 | 含义 | GLM-5.2 | GLM-5.3 |
|---|---|---|---|
| Terminal-Bench 3.0 | 终端命令行 Agent 任务 | 4.6 | 28.3 |
| DeepSWE v1.1 | 软件工程 Agent 端到端完成率 | 46.2 | 66.9 |
| Agents' Last Exam | 综合 Agent 能力压力测试 | 23.8 | 28.5 |
| CyberGym | 从源码发现并验证漏洞的能力 | 77.2% | 84.5% |
| ExploitBench | 真实漏洞的深度利用推理能力 | 24.4% | 54.4% |
Terminal-Bench 3.0 从 4.6 分跃升到 28.3 分,接近六倍的提升幅度,是这次更新里最直观的编程能力跃迁;DeepSWE v1.1 也从 46.2 提升到 66.9。官方将这称为整体编程能力"提升 50%",在开源模型阵营的公开基准(包括 Terminal-Bench 3.0 在内的多项命令行脚本能力测试)中排名第一。第三方评测也提到,GLM-5.3 的编程与 Agent 能力已经"接近 Claude Fable 5"的水平,同时保持了更高的 token 效率——完成同等复杂度任务大约只需要 5 万输出 token,相比之下 Claude Opus 系列大约需要 12 万 token,这对大规模跑 Agent 流水线的团队而言是实打实的成本优势。不过在 Code Bench 等部分基准上,GLM-5.3(31.4%)仍落后于 Claude Fable 5(39.5%),说明它还不是全面领先。
真正让这次发布出圈的是网络安全维度的数据:CyberGym(考察从源码中发现并验证漏洞的能力)上 84.5% 的得分,略微超过了 Anthropic 内部受限使用的 Mythos 5(83.8%)和 OpenAI GPT-5.6 Sol(83.6%);但在更考验深度利用链推理的 ExploitBench 上,GLM-5.3 的 54.4% 仍明显落后于 Mythos 5 的 78.0%,说明它在"找得到漏洞"和"能完整打穿一条利用链"之间还有差距,但差距正在快速缩小。真实世界测试的结果更直接:团队用 GLM-5.3 审计了 269 个开源项目,共发现 2436 个漏洞,其中 1097 个被判定为高危或严重级别,甚至定位到了一处存在近四十年的历史代码缺陷——这类"深挖老代码"的能力,恰恰是最需要警惕被滥用的方向。
3. 为什么推迟开源:行业首例"因网络安全能力超预期而暂缓"
按 Z.ai 官方的说法,GLM-5.3 的网络安全能力"增长速度超出了预期"(grew faster than anticipated),这是团队决定将原定同步开源的模型权重推迟约两周发布的直接原因,多出来的时间将用于额外的安全评估和防护措施加固。这与 OpenAI 因 Astra 模型触及"Critical"红线而暂停发布的逻辑相似——都是"能力测评结果超出团队预判,先暂停/推迟,再补做安全工作"——但 GLM-5.3 是目前已知第一个公开以"涌现出的网络安全能力"为具体理由主动推迟开源权重的主力开源模型,而不是使用泛泛的安全免责声明。对于开源生态而言,这释放出一个信号:网络安全能力的"红线"审查,正在从少数闭源前沿模型,扩展到开源权重发布的常规流程里,未来可能会有更多开源厂商效仿这种"先测评、后开源"的节奏。
需要说明的是,目前 GLM-5.3 已经可以通过 Z.ai 的 GLM Coding Plan 订阅服务使用(Lite/Pro/Max 三档,月付分别约 18/80/168 美元,年付有折扣),但官方 API 定价表截至发稿仍只列到 GLM-5.2(每百万 token 输入 1.4 美元、缓存输入 0.26 美元、输出 4.4 美元),尚未公布 5.3 的独立按 token 计费价格,需要等两周后权重与完整 API 定价一起放出。
三、实践指南:如何调用与关注要点
如果你已经接入 Z.ai 的 GLM Coding Plan(例如通过 Claude Code、Cline 等第三方编程工具),可以直接把模型 ID 切换为 glm-5.3(长上下文场景使用 glm-5.3[1m] 后缀,对应 100 万 token 的压缩上下文窗口)体验新版本。直接调用官方 API 的示例如下:
curl -X POST "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{"role": "user", "content": "帮我审查这段并发代码是否存在数据竞争,并给出修复方案"}
],
"thinking": {"type": "enabled"},
"reasoning_effort": "max"
}'2
3
4
5
6
7
8
9
10
11
几点需要留意:
thinking必须开启:GLM-5.3 当前不支持关闭思考过程(thinking.type: "disabled"不受支持),这和它这一代把推理能力作为核心卖点的定位一致,调用前要留意这一点避免请求报错。- 长上下文用
[1m]后缀:如果任务涉及整仓库级别的代码审查或长文档处理,走 Coding Plan 路线并使用glm-5.3[1m]变体可以拿到 100 万 token 的压缩上下文窗口。 - 把它当安全审计工具用要有边界意识:GLM-5.3 在真实项目中挖出上千个漏洞的能力,意味着它已经是一个相当高效的自动化漏洞挖掘工具。如果你打算把它接入自己的代码审计流程,建议只在你有权限审计的代码库(自己的项目、授权的众测项目)上使用,并对输出的漏洞报告做人工复核,不要在未经授权的第三方系统上运行自动化利用链。
- API 定价尚未最终确定:目前只有 Coding Plan 订阅价格公开,如果你的团队计划按 token 付费大规模调用,建议先用订阅额度做小范围压测,等两周后权重开源和完整 API 定价公布后再做最终选型决策。
- 关注两周后的权重发布:Z.ai 计划在完成安全加固后将 GLM-5.3 权重以开源许可发布到 Hugging Face,对于希望本地部署、微调或做安全研究的团队,这个时间点值得标记关注。
四、总结与展望
GLM-5.3 这次发布提供了两个值得记住的信号。第一,它进一步验证了"后训练规模化"正在成为 2026 年下半年大模型迭代的主流路径之一——不换基座、靠更长的后训练和更丰富的任务环境去"压榨"性能,Terminal-Bench 3.0 六倍的提升幅度证明这条路径的效率上限还远没有摸到。第二,也是更重要的一点:一个开源权重模型的网络安全能力第一次公开触发了"暂缓发布、补做安全加固"的行业先例,这把此前主要属于闭源前沿模型讨论范畴的"能力红线"问题,直接摆到了开源生态面前。结合本月 OpenAI Astra、GPT-5.6-Cyber 的一系列动态,可以看到一个越来越清晰的趋势:随着大模型的编程与 Agent 能力持续逼近甚至反超顶尖安全研究员的水平,"发布前的网络安全能力评估"正在从可选项变成新模型上线前的标准环节,无论这个模型最终是开源还是闭源。对国内开发者和安全团队来说,GLM-5.3 两周后开源的权重,以及它在真实项目中展现出的漏洞挖掘能力,都值得提前关注和评估——无论是作为编程助手引入研发流程,还是作为自动化安全审计工具纳入内部测试体系,都需要在拿到能力的同时,同步建立起相应的使用边界和授权机制。
参考来源
- Z.ai Unveils GLM-5.3, a Revolutionary Open-Source Language Model — ChinaTechNews.com
- Zhipu AI Releases GLM-5.3: Coding Capability Jumps 50%, Open-Source Weights Coming in Two Weeks — BigGo Finance
- China's Z.ai holds GLM 5.3 release over hacking risks — Axios
- China's AI startup Z.ai says open-source GLM-5.3 beats Anthropic's Mythos 5 in cybersecurity test — Tech Startups
- GLM 5.3: Benchmarks, Pricing and the Held-Back Weights — felloai
- GLM-5.3 Just Launched: Specs, Benchmarks, API & How to Use It — Kingy AI
💬 评论