Skip to main content
GLM-5.3 模型 API 即将上线,敬请期待。GLM Coding Plan 已全量上线 GLM-5.3,让开发与工作效率全面进阶! 立即订阅

概览

智谱最新旗舰模型,以极致后训练 Scaling 实现能力跃迁。在与 GLM-5.2 完全相同的基座上,依托数十倍规模的长程任务环境、更丰富多样的环境类型与超长周期的后训练,编程体感较前代提升 50%,并在 Terminal Bench 3.0 等公开基准中位列开源模型第一;同时涌现出强大的网络安全能力,在白盒代码审查、漏洞发现等任务中的表现接近 Mythos 5。

定位

旗舰基座模型

输入模态

文本

输出模态

文本

上下文窗口

1M

最大输出 Tokens

128K

能力支持

思考模式

提供多种思考模式,覆盖不同任务需求

流式输出

支持实时流式响应,提升用户交互体验

Function Calling

强大的工具调用能力,支持多种外部工具集成

上下文缓存

智能缓存机制,优化长对话性能

结构化输出

支持 JSON 等结构化格式输出,便于系统集成

MCP

可灵活调用外部 MCP 工具与数据源,扩展应用场景

详细介绍

1

编程与 Agent 能力再突破

在多项主流基准测试中,GLM-5.3 是当前位居前列的开源模型,编程与智能体能力比肩 Claude Fable 5,实际编程体感领先其他国产模型。Terminal-Bench 3.0 从 4.6 提升至 28.3,DeepSWE v1.1 从 46.2 提升至 66.9,Agents’ Last Exam 从 23.8 提升至 28.5;在覆盖 44 种职业的 GDPval-AA v2 中取得 1769 分,展现出从编程向专业任务执行延伸的能力。Description
2

不只做出 Demo,更能交付复杂项目

GLM-5.3 能够接住更复杂、更长期的工程目标,在数万行代码、上百个文件及多个相互依赖的系统之间持续推进。面对前端开发、Bug 修复、代码重构等真实任务,它可以在极少人工干预下自主开发、反复验证,将项目推进至可交付状态。
3

在真实专家工作流中完成后训练 Scaling

GLM-5.3 的训练不再局限于孤立的编程题,而是扩展至从发现问题、分析方案到实施、验证和交付的完整流程。部分训练任务相当于资深工程师连续数天的工作量,模型需要使用真实的计算集群、存储系统、内部文档与代码库完成任务。在相近 Token 预算下,GLM-5.3 也在完成质量、执行速度和使用成本之间取得了更好的平衡。Description
4

涌现出更强的网络安全能力

随着长程任务环境不断扩展,GLM-5.3 在白盒代码审查、漏洞发现与验证等安全任务中涌现出超出预期的能力。CyberGym 得分达到 84.5%,略高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%;ExploitBench 得分由 24.4% 提升至 54.4%。目前优势主要集中在漏洞利用链前端,在更深入的漏洞利用与完整攻防任务上仍有提升空间。Description

使用资源

GLM-5.3 模型 API 将于近期上线,上线后将同步开放完整调用示例与模型体验中心,敬请关注。