Skip to main content

推荐模型

GLM-5.2

最新旗舰模型
  • 开源 SOTA 能力
  • 1M 无损上下文

GLM-5V-Turbo

多模态 Coding 模型
  • 兼顾视觉与 Coding 能力
  • 多模态工具链进一步扩展

GLM-Image

图像生成模型
  • 文字渲染开源 SOTA
  • 支持多分辨率

模型一览

若需要看模型价格,请直接前往价格页面

文本模型

文本模型是一类专注于处理和生成自然语言的模型,涵盖了语言理解与推理能力,能够自动处理海量文本数据并进行逻辑推导。智谱的文本模型结合了强大的语言模型和推理模型,使得系统不仅能理解和生成文本内容,还能进行高层次的推理和判断。
模型特点上下文最大输出
GLM-5.21M 上下文,支撑复杂长程任务稳定执行
Coding 能力开源 SOTA,从代码生成走向工程交付
1M128K
GLM-5.1Coding 能力对齐 Claude Opus 4.6
长程任务显著提升,可自主工作长达 8 小时
200K128K
GLM-5编程能力对齐 Claude Opus 4.5
擅长 Agentic 长程规划与执行
200K128K
GLM-5-Turbo龙虾任务核心需求专项优化
复杂长任务执行连续性好
200K128K
GLM-4.7通用对话、推理与智能体能力上全面升级
编程更强、更稳、审美更好
200K128K
GLM-4.7-FlashX轻量高速,小尺寸强能力
适用于中文写作、翻译、角色扮演等通用场景
200K128K
GLM-4.6上下文提升至 200K
擅长高级编码、复杂推理与工具调用
200K128K
GLM-4.5-Air高性价比轻量模型
推理、编码与智能体任务表现稳定
128K96K
GLM-4.5-AirX高性价比极速版本
适合低延迟、高响应要求的业务场景
适用于时效性有较强要求的场景
128K96K
GLM-4-Long支持高达 1M 上下文长度
能够理解和回应复杂的查询
为处理超长文本和记忆型任务设计
1M4K
GLM-4-FlashX-250414Flash 增强高速版本
推理速度快,适合高并发调用场景
128K16K
GLM-4.7-Flash免费模型,提供普惠体验
延续 GLM-4.7 基座的通用能力
200K128K
GLM-4.5-Flash
(即将下线)
免费模型,支持深度思考模式
支持最长 128K 的上下文处理
128K96K
GLM-4-Flash-250414免费模型,支持长上下文处理
适合多语言理解与工具调用场景
128K16K

视觉模型

视觉模型是一类能处理图像或视频等视觉信息的模型,广泛应用于识别、分析与决策任务。其中,视觉理解模型侧重于看懂图像内容,如识别物体、场景和关系;而视觉推理模型进一步具备看图思考的能力,能结合视觉与语言信息完成逻辑判断、因果分析和多步推理,常用于图文问答、图像描述生成、多模态对齐等复杂任务。
模型特点上下文最大输出
GLM-5V-Turbo多模态 Coding 基座
兼顾视觉理解、推理与代码生成
适配 Agent 工作流与长上下文任务
200K128K
GLM-4.6V视觉推理能力增强
原生支持工具调用与长上下文
前端代码复刻效果更稳定
128K32K
GLM-OCR轻量图文解析模型
兼顾高精度、高效率文档理解
支持常见复杂版式解析
输入:单图 ≤ 10 MB,
PDF ≤ 50 MB
最大支持 100 页
AutoGLM-Phone手机智能助理框架
支持自然语言完成 App 操作任务
覆盖完整移动端操作指令集
20K2048
GLM-4.1V-Thinking-FlashX轻量视觉推理模型
擅长复杂场景理解与多步骤分析
适合高并发视觉推理场景
64K16K
GLM-4.6V-Flash免费模型,支持视觉推理
支持工具调用与长上下文处理
可灵活开关思考模式
128K32K
GLM-4.1V-Thinking-Flash免费模型,支持视觉推理
擅长复杂场景理解与多步骤分析
适合通用多模态理解任务
64K16K
GLM-4V-Flash免费模型,支持图像理解
具备基础多模态问答能力
适合轻量视觉理解场景
16K1K

图像生成模型

图像生成模型是一类通过学习海量图像数据,实现从文本生成高质量图片的模型,广泛应用于视觉内容创作、游戏美术、产品设计、医学影像合成等领域。
模型特点多分辨率
GLM-Image旗舰图像生成模型
复杂指令遵循与知识密集生成更强
文字渲染表现突出,汉字尤其出色
支持
CogView-4通用图像生成模型
生成质量高,风格表达丰富多样
画面细节更完整,适合多类创意场景
支持
CogView-3-Flash免费模型,创意生成灵活
生成速度快,适合轻量图像创作
兼顾基础质量与多样化表达
支持

视频生成模型

视频生成模型是一类通过学习时序视觉数据,从文本、图像或其他视频素材生成动态视频内容的模型,广泛应用于影视制作、虚拟人、动画生成、数字营销等领域。
模型特点多模态支持多分辨率
CogVideoX-3高智能旗舰视频模型
画质清晰度、指令遵循与物理模拟更强
现实与 3D 场景表现提升,支持首尾帧生成
图像、文本、
首尾帧
支持
Vidu Q1高质量视频生成模型
画质清晰,转场流畅,风格表达更丰富
可减少画面崩坏,适合高质量成片场景
图像、文本、
首尾帧
不支持
Vidu 2高速低价视频模型
生成速度快,兼顾成本与输出效果
首尾帧衔接自然,多参考图一致性更强
图像、参考、
首尾帧
不支持
CogVideoX-Flash免费模型,支持视频生成
支持 AI 音效、4K 画质与 60fps 输出
支持最长 10 秒视频生成,适合轻量创作
图像、文本支持

音视频模型

音视频模型是一类处理音频与视频信号的多模态模型,能够理解、生成或编辑视听内容,广泛应用于虚拟人、语音驱动动画、视频配音与剪辑、跨模态检索等场景。
模型特点多模态支持
GLM-TTS语音合成模型
支持超拟人语音生成与情感表达
提供非流式与流式接口
文本
GLM-TTS-Clone音色克隆模型
3 秒音频即可快速生成相似音色
支持普通话、轻口音与细腻情感表达
文本、音频
GLM-ASR-2512高精度语音识别模型
字符错误率低,支持自定义词汇
覆盖多种主流语言与方言场景
音频
GLM-Realtime实时音视频模型
支持视频通话与长时对话记忆
具备跨文本、音频和视频的实时推理能力
视频、音频、文本
GLM-4-Voice实时语音对话模型
支持中英文语音理解与生成
可按指令调整情感、语调、语速和方言
文本、音频

向量模型

向量模型用于将高维的离散数据转换为低维的连续向量,捕捉数据的语义特征和关系。您可以使用我们的向量模型构建语义检索增强、聚类、主题建模和分类等功能。
模型定位上下文
Embedding-3V38K
Embedding-2V28K

其他模型

模型特点上下文最大输出
CharGLM-4拟人对话模型
适合情感陪伴与虚拟角色互动
支持更自然的人设化表达
8K4K
Emohaa心理情感支持模型
具备专业咨询与情绪疏导能力
帮助用户理解情感、应对问题
8K4K
CodeGeeX-4代码补全模型
适用于代码自动补全与开发辅助
提升编码效率与连续编写体验
128K32K
Rerank文本重排序模型
计算文本相关性 score 值
优化召回结果排序与匹配效果
4K-

即将弃用模型

我们已经宣布了以下模型的弃用日期。在这些模型弃用后,我们会将它们自动路由至新的模型。请用户注意在弃用日期之前,将您的模型编码更新为最新版本,以确保服务的顺畅过渡。
模型弃用时间指向模型
GLM-Z1 系列2025 年 11 月 15 日-
GLM-4-05202025 年 12 月 30 日-