概览
GLM-5.3 是智谱最新旗舰模型,复杂软件工程与 Agent 任务能力全面进阶。它使用与 GLM-5.2 相同的基础模型——所有提升均来自后训练。与 GLM-5.2 相比,它在复杂编程和长程任务方面表现更加出色:- 更强的编程能力 GLM-5.3 的编程能力大幅提升,在智谱内部 Z.ai Code Bench 上较 GLM-5.2 提升了 50%,在包括 Terminal Bench 3.0、Agents’ Last Exam (CLI) 在内的公开基准测试中达到开源模型 SOTA 水平。
- 涌现的网络安全能力 随着后训练规模持续扩大,模型的网络安全能力以超出预期的速度提升。GLM-5.3 在漏洞发现基准 CyberGym 上取得当前最佳成绩;越深入漏洞利用链,其相较 GLM-5.2 的提升越显著,在漏洞利用类基准测试中的得分达到 GLM-5.2 的两倍以上。
功能变更
GLM-5.3 目前仅支持处理文本模态信息,支持 1M 上下文窗口,最大输出 Tokens 为 128K。GLM-5.3 会始终启用思考功能,支持三个思考强度级别:
low、high 和 max,并不再支持禁用思考功能。思考功能参数说明如下:
迁移提示:如果您的应用当前使用
thinking.type: "disabled",请在将模型 ID 更新为 glm-5.3 之前,将其更改为 enabled,并将 reasoning_effort 设置为 low。否则,请求将失败。max,示例如下:
如何使用
-
GLM Coding Plan
已全面开放,您可以在常用的编程智能体中使用 GLM-5.3。使用指南
新版 GLM Coding Plan 采用基于积分的配额系统,额度公开透明。在包括周末全天在内的非高峰时段进行的模型调用仅消耗标准积分的 50%。
立即订阅:个人版、团队版。 -
模型 API
将于近期上线,上线后将同步开放完整调用示例,敬请关注。支持的协议与接入端点如下:
如果您有订阅过 GLM Coding Plan(含已过期),那么暂时您只能通过 OpenAI Chat Completion 协议调用模型 API,我们将在近期迭代优化。
能力支持
- 思考模式:提供多种思考模式,覆盖不同任务需求
- 流式输出:支持实时流式响应,提升用户交互体验
- Function Calling:强大的工具调用能力,支持多种外部工具集成
- 上下文缓存:智能缓存机制,优化长对话性能
- 结构化输出:支持 JSON 等结构化格式输出,便于系统集成
详细介绍
GLM-5.3 在复杂软件工程、终端操作和更广泛的真实世界 Agent 任务上均取得显著进步。
更强大的编程能力
在 GLM-5.3 的训练中,我们进一步推进了任务环境的规模化建设,使训练任务不再只是传统的编程题,而是更接近专家在真实工作中承担的完整专业工作单元。这些环境覆盖了更广泛的生产级工作流,任务设计也更加贴近工程与研究工作的实际开展方式,其中部分任务即使由经验丰富的工程师完成,也需要数天时间。 例如,在一项机器学习基础设施任务中,模型可能会获得与工程师相同的工作环境,包括计算集群、存储系统、内部文档、代码库和实验结果等资源。模型需要定位训练技术栈中的性能瓶颈,实施优化方案,运行实验,并在保证结果正确性的前提下,实现可量化的端到端加速。通过在此类高复杂度环境中训练,推动模型逐步具备端到端负责并完成复杂工作的能力,而不再依赖用户拆解问题并逐步监督执行。 随着智能体能力提升,后训练规模化的主要难点也逐渐从模型本身转移到任务环境。一个真正有价值的任务环境必须可执行、可验证,并贴近真实的专业工作;同时,我们需要的不是少量人工构建的环境,而是大规模、多样化的任务环境。为实现这一过程的规模化,我们构建了能够端到端合成任务环境的流水线,并针对部分任务进一步自动生成强化学习所需的奖励信号。研究智能体从真实工作中收集任务模式,并将其转化为可运行的长程任务环境,其中包含多步骤依赖关系和隐藏状态;随后,评审智能体会实际尝试完成每项任务,以验证任务是否确实可解。验证器在不访问参考解法的前提下生成;与此同时,系统会利用求解轨迹识别并消除奖励捷径。只有同时通过 Oracle、空操作和未解决状态检查的验证器,其生成的二值奖励信号才足够可靠,可直接用于模型训练。 GLM-5.3 延续了 GLM-5.2 中引入的强化学习策略,包括结合上下文压缩机制的 SAO,使能力增益能够在长程任务中持续体现,而非仅局限于短程任务。这些提升同时反映在编程任务和通用智能体任务中:GLM-5.3 在 Terminal-Bench 3.0 上的得分由 4.6 提升至 28.3,在 DeepSWE v1.1 上由 46.2 提升至 66.9,在 Agents’ Last Exam 上由 23.8 提升至 28.5。目前,这些流水线仍需要较多人工参与。进一步提升任务环境生成与验证过程的自主化程度,是我们下一阶段的重点方向之一。 除公开基准测试外,我们还推出了内部基准 Z.ai Code Bench,用于在贴近真实用户场景的条件下评估编程智能体。该基准覆盖多种任务类别,并将智能体置于复杂的本地开发环境中。在不同推理强度档位下,我们从两个维度评估智能体:一是端到端任务完成率,二是细粒度检查项准确率。作为一项非公开基准,Z.ai Code Bench 还能降低公开测试集污染带来的风险,从而更准确地反映模型在真实用户场景中的使用体验。
如图所示,GLM-5.3 在能力表现和 Token 效率上均取得了提升。在所有推理强度档位下,GLM-5.3 的智能体编程表现均显著优于 GLM-5.2,同时消耗更少的输出 Token。在 Max 档位下,GLM-5.3 的准确率达到 34.5%,每项任务平均输出约 7.5 万 Token;相比之下,GLM-5.2 的准确率为 23.4%,平均输出约 9.6 万 Token。与闭源模型的对比也呈现出相同趋势:在 High 档位下,GLM-5.3 在每项任务平均输出约 5 万 Token 的情况下,准确率达到 31.4%,超过 Claude Opus 4.8 在每项任务平均输出约 12 万 Token 时取得的 29.5%。GLM-5.3 与 Claude Fable 5 仍存在差距,后者在 Max 档位下的准确率达到 39.5%。
涌现的网络安全能力
在后训练阶段,我们将漏洞发现相关的数据与环境纳入训练体系。我们原本预计,这会提升模型发现漏洞并对其进行分析推理的能力。令人意外的是,随着训练规模持续扩大,这项能力也迅速演进。GLM-5.3 不仅更擅长识别孤立的安全缺陷,还开始能够跨越漏洞利用的多个阶段进行推理,形成连贯、完整的漏洞利用链方案。 我们通过三个分别覆盖漏洞分析与利用不同阶段的基准测试,对 GLM-5.3 进行了评估。
在 CyberGym 上,模型需要从白盒源代码出发,通过触发程序异常来识别并验证漏洞。GLM-5.3 得分达到 84.5%,较 GLM-5.2 的 77.2% 明显提升,并取得该基准当前最佳成绩,超过 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。在 ExploitBench 上,模型需要对真实漏洞及其利用方式进行更深入的推理。GLM-5.3 得分达到 54.4%,较 GLM-5.2 的 24.4% 提升一倍以上;作为对比,Mythos 5 和 GPT-5.6 Sol 的得分分别为 78.0% 和 76.5%。在 ExploitGym 上,评测关注模型在经过时间归一化的预算下能够完成多少项漏洞利用任务。GLM-5.3 在两小时内完成 105 项任务、六小时内完成 130 项任务,显著高于 GLM-5.2 的 29 项和 39 项。Mythos 5 仍保持明显领先,两小时和六小时内分别完成 181 项和 247 项任务。
三个基准呈现出一致的趋势:基准测试覆盖的漏洞利用链阶段越深入,GLM-5.3 相比 GLM-5.2 的提升就越显著;与此同时,与闭源前沿模型之间的差距也越大。换言之,当前差距最大的方向,恰恰也是我们能力增长最快的方向。
随后,我们进一步测试这些能力能否从受控基准评测迁移到真实场景。自 GLM-5.2 起,我们便与中国多家安全团队合作,使用模型对真实代码库开展安全测试。经专家复核、筛选与去重,模型在 269 个项目中共发现 2,436 个漏洞,其中包括 1,097 个中高危漏洞。这些漏洞广泛分布于系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议等领域。许多漏洞此前已潜藏数年甚至数十年而未被发现,其中存在时间最长的漏洞已在代码库中潜藏约 40 年。
这项工作进一步发展为一项持续开展的漏洞披露计划。我们建立了 Z.ai 安全漏洞披露台账,用于公开记录相关漏洞在披露流程中的进展。随着新漏洞陆续完成审核并推进披露,该台账会持续更新,并明确区分已经公开的漏洞与仍处于协调披露阶段的漏洞。对于已披露漏洞,台账会记录受影响项目、漏洞严重等级、对应的 CVE 编号(如有),以及该漏洞在代码库中潜藏的时间等信息。