Skip to main content

概览

GLM-4.6V-Flash 是 GLM-4.6V 的免费版本,是 GLM 系列在多模态方向上的一次重要迭代,支持开启或关闭思考模式。它将训练时上下文窗口提升到128k tokens,在 视觉理解精度上达到同参数规模 SOTA,并首次在模型架构中将 Function Call(工具调用)能力原生融入视觉模型,打通从「视觉感知」到「可执行行动(Action)」的链路,为真实业务场景中的多模态 Agent 提供统一的技术底座。

输入模态

视频、图像、文本、文件

输出模态

文本

上下文窗口

128K

能力支持

深度思考

支持开启或关闭思考模式,可灵活开关深层推理分析

视觉理解

强大的视觉理解能力,支持图片,视频,文件

流式输出

支持实时流式响应,提升用户交互体验

Function Call

强大的工具调用能力,支持多种外部工具集成

上下文缓存

智能缓存机制,优化长对话性能

推荐场景

图片OCR信息提取、图片内容理解与其相关属性提取

使用资源

体验中心

快速测试模型在业务场景上的效果

接口文档

API 调用方式
MCP 工具
  • 万物识别 MCP:能够对图片中的地点与人物信息进行快速识别与分析。支持整图识别和对图片局部区域进行精准识别
  • 图像搜索 MCP:能够快速返回图片及网页相关信息,支持文本搜索、图片搜索、反向图片搜索及区域搜索等多种检索方式
  • 图像处理 MCP:提供便捷、高效的图像处理(如裁剪、获取Url、画框等)能力

详细介绍

1

原生多模态工具调用

传统工具调用大多基于纯文本,在面对图像、视频、复杂文档等多模态内容时,需要多次中间转换,带来信息损失和工程复杂度。 GLM-4.6V 从设计之初就围绕 「图像即参数,结果即上下文」 ,构建了原生多模态工具调用能力:
  • 输入多模态:图像、截图、文档页面等可以直接作为工具参数,无需先转为文字描述再解析,减少链路损耗。
  • 输出多模态:对于工具返回的统计图表、渲染后网页截图、检索到的商品图片等结果,模型能够再次进行视觉理解,将其纳入后续推理链路。 模型原生支持基于视觉输入的工具调用,完整打通从感知到理解到执行的闭环。这使得 GLM-4.6V 能够应对图文混排输出、商品识别与好价推荐、以及辅助型 Agent 场景等更复杂的视觉任务。
在内容创作与知识分发场景中,GLM-4.6V 可以从多模态输入中,自动构建高质量图文输出:无论是直接输入图文混杂的论文、研报、PPT,还是只给出一个主题,模型都能生成结构清晰、图文并茂的社交媒体内容。
  • 复杂图文理解:接收包含文本、图表、公式的文档,准确抽取结构化关键信息。
  • 多模态工具调用:在生成内容过程中,自动调用检索/搜索类工具,为每一段落寻找候选图片,或从原文中截取关键配图。
  • 图文混排输出与质量控制:对候选图片进行「视觉审核」,评估其与文字内容的相关性与质量,自动过滤无关或低质图片,输出可直接用于公众号、社交媒体或知识库的结构化图文结果。
这一流程中,多模态理解、工具调用与质量控制均由 GLM-4.6V 模型独立在同一推理链路内完成。⬆️案例1:仅输入主题,生成图文资讯⬆️案例2:输入论文,生成图文并茂的科普文章
2

同规模开源 SOTA

GLM-4.6V 在 MMBench、MathVista、OCRBench 等 30+ 主流多模态评测基准 上进行了验证,较上一代模型取得显著提升。在同等参数规模下,模型在多模态交互、逻辑推理和长上下文等关键能力上取得 SOTA 表现。其中 9B 版本的 GLM-4.6V-Flash 整体表现超过 Qwen3-VL-8B,106B 参数 12B 激活的 GLM-4.6V 表现比肩 2 倍参数量的 Qwen3-VL-235B。Description

调用示例

基础与流式

基础调用
流式调用

多模态理解

不支持同时理解文件、视频和图像。
图片理解
视频理解
文件理解