> ## Documentation Index
> Fetch the complete documentation index at: https://docs.bigmodel.cn/llms.txt
> Use this file to discover all available pages before exploring further.

# API 定价

> 模型推理、搜索工具、知识库、模型微调及私有实例等服务价格说明

平台提供模型推理等多种 API 服务。模型推理采用按量计费模式，根据实际使用量扣费，便于灵活控制业务成本。

* [旗舰模型](#旗舰模型)
* [模型推理](#模型推理)
* [搜索工具服务](#搜索工具服务)
* [知识库服务](#知识库服务)
* [模型微调](#模型微调)
* [模型私有实例](#模型私有实例)
* [云端私有化套餐](#云端私有化套餐)
* [本地私有化解决方案](#本地私有化解决方案)
* [计费常见问题](#计费常见问题)

## 计费基本概念

Token 是模型处理内容时使用的基本计量单位，可能对应一个单词、汉语词语或短句、标点符号、数字等。通常情况下，GLM 系列模型的 Token 与汉字数量换算比例约为 1:1.6，实际数量以接口返回的用量信息为准。

模型推理通常按照输入 Tokens、输出 Tokens 和缓存命中 Tokens 分别计费：

`调用费用 = 未命中缓存的输入费用 + 缓存命中费用 + 输出费用 + 缓存存储费用`

除特别说明外，模型价格统一按照“元/百万 Tokens”展示。图片、视频、语音等模型如采用按次、按分钟或按字符计费，将在对应价格表中单独标明。

## 旗舰模型

最新一代旗舰模型，覆盖文本与多模态任务。详细能力、接口参数及当前可用模型，请参见[模型概览](/cn/guide/start/model-overview)。

| 模型名称          | 上下文 | 输入单价（元/百万 Tokens） | 输出单价（元/百万 Tokens） | 缓存存储（元/百万 Tokens/小时） | 缓存命中（元/百万 Tokens）   | 输入模态        |
| ------------- | --- | ----------------- | ----------------- | -------------------- | ------------------- | ----------- |
| GLM-5.3       | 1M  | 8                 | 28                | 限时免费                 | 2                   | 文本          |
| GLM-5.3-Flash | 1M  | 0.4（~~刊例价 0.8~~）  | 1.4（~~刊例价 2.8~~）  | 限时免费                 | 0.115（~~刊例价 0.23~~） | 图片、视频、文件、文本 |

> GLM-5.3-Flash 表中划线价格为刊例价，当前限时 5 折优惠，活动截止 2026 年 9 月 9 日 24:00（UTC+8，北京时间），到期后自动恢复为刊例价。

## 模型推理

平台提供覆盖文本、视觉、多模态生成、语音和向量等场景的模型 API。除特别说明外，模型按照实际 Token 用量计费；图像、视频和部分语音模型按照请求次数、字符数或音频时长计费。

### 文本模型

| 模型名称        | 上下文            | 输入单价（元/百万 Tokens） | 输出单价（元/百万 Tokens） | 缓存存储（元/百万 Tokens/小时） | 缓存命中（元/百万 Tokens） |
| ----------- | -------------- | ----------------- | ----------------- | -------------------- | ----------------- |
| GLM-5.2     | 1M             | 8                 | 28                | 限时免费                 | 2                 |
| GLM-5.1     | 输入长度 \[0, 32K) | 6                 | 24                | 限时免费                 | 1.3               |
| GLM-5.1     | 输入长度 ≥32K      | 8                 | 28                | 限时免费                 | 2                 |
| GLM-5-Turbo | 输入长度 \[0, 32K) | 5                 | 22                | 限时免费                 | 1.2               |
| GLM-5-Turbo | 输入长度 ≥32K      | 7                 | 26                | 限时免费                 | 1.8               |
| GLM-5       | 输入长度 \[0, 32K) | 4                 | 18                | 限时免费                 | 1                 |
| GLM-5       | 输入长度 ≥32K      | 6                 | 22                | 限时免费                 | 1.5               |

<Accordion title="更多文本模型">
  | 模型名称                | 上下文                        | 输入单价（元/百万 Tokens） | 输出单价（元/百万 Tokens） | 缓存存储（元/百万 Tokens/小时） | 缓存命中（元/百万 Tokens） |
  | ------------------- | -------------------------- | ----------------- | ----------------- | -------------------- | ----------------- |
  | GLM-4.7             | 输入 \[0, 32K)，输出 \[0, 0.2K) | 2                 | 8                 | 限时免费                 | 0.4               |
  | GLM-4.7             | 输入 \[0, 32K)，输出 ≥0.2K      | 3                 | 14                | 限时免费                 | 0.6               |
  | GLM-4.7             | 输入 \[32K, 200K)            | 4                 | 16                | 限时免费                 | 0.8               |
  | GLM-4.5-Air         | 输入 \[0, 32K)，输出 \[0, 0.2K) | 0.8               | 2                 | 限时免费                 | 0.16              |
  | GLM-4.5-Air         | 输入 \[0, 32K)，输出 ≥0.2K      | 0.8               | 6                 | 限时免费                 | 0.16              |
  | GLM-4.5-Air         | 输入 \[32K, 128K)            | 1.2               | 8                 | 限时免费                 | 0.24              |
  | GLM-4.7-FlashX      | 200K                       | 0.5               | 3                 | 限时免费                 | 0.1               |
  | GLM-4.7-Flash       | 200K                       | 免费                | 免费                | 限时免费                 | 免费                |
  | GLM-4-Plus          | 128K                       | 5                 | 5                 | 限时免费                 | 2.5               |
  | GLM-4-Air-250414    | 128K                       | 0.5               | 0.5               | 限时免费                 | 0.25              |
  | GLM-4-AirX          | 8K                         | 10                | 10                | 限时免费                 | 不支持               |
  | GLM-4-Long          | 1M                         | 1                 | 1                 | 限时免费                 | 0.5               |
  | GLM-4-Assistant     | 128K                       | 5                 | 5                 | 限时免费                 | 不支持               |
  | GLM-Z1-Air          | 128K                       | 0.5               | 0.5               | 限时免费                 | 不支持               |
  | GLM-Z1-AirX         | 32K                        | 5                 | 5                 | 限时免费                 | 不支持               |
  | GLM-Z1-FlashX       | 128K                       | 0.1               | 0.1               | 限时免费                 | 不支持               |
  | GLM-4-FlashX-250414 | 128K                       | 0.1               | 0.1               | 限时免费                 | 0.05              |
  | GLM-4-Flash-250414  | 128K                       | 免费                | 免费                | 限时免费                 | 不支持               |
  | GLM-Z1-Flash        | 128K                       | 免费                | 免费                | 限时免费                 | 不支持               |
</Accordion>

### 视觉理解

| 模型名称         | 上下文            | 输入单价（元/百万 Tokens） | 输出单价（元/百万 Tokens） | 缓存存储（元/百万 Tokens/小时） | 缓存命中（元/百万 Tokens） |
| ------------ | -------------- | ----------------- | ----------------- | -------------------- | ----------------- |
| GLM-OCR      | 32K            | 0.2               | 0.2               | 限时免费                 | 不支持               |
| GLM-5V-Turbo | 输入长度 \[0, 32K) | 5                 | 22                | 限时免费                 | 1.2               |
| GLM-5V-Turbo | 输入长度 ≥32K      | 7                 | 26                | 限时免费                 | 1.8               |

<Accordion title="更多视觉模型">
  | 模型名称                     | 上下文               | 输入单价（元/百万 Tokens） | 输出单价（元/百万 Tokens） | 缓存存储（元/百万 Tokens/小时） | 缓存命中（元/百万 Tokens） |
  | ------------------------ | ----------------- | ----------------- | ----------------- | -------------------- | ----------------- |
  | GLM-4.6V                 | 输入长度 \[0, 32K)    | 1                 | 3                 | 限时免费                 | 0.2               |
  | GLM-4.6V                 | 输入长度 \[32K, 128K) | 2                 | 6                 | 限时免费                 | 0.4               |
  | GLM-4.6V-FlashX          | 输入长度 \[0, 32K)    | 0.15              | 1.5               | 限时免费                 | 0.03              |
  | GLM-4.6V-FlashX          | 输入长度 \[32K, 128K) | 0.3               | 3                 | 限时免费                 | 0.03              |
  | GLM-4.6V-Flash           | —                 | 免费                | 免费                | 限时免费                 | 免费                |
  | GLM-4.5V                 | 输入长度 \[0, 32K)    | 2                 | 6                 | 限时免费                 | 0.4               |
  | GLM-4.5V                 | 输入长度 \[32K, 64K)  | 4                 | 12                | 限时免费                 | 0.8               |
  | GLM-4V-Plus-0111         | 16K               | 4                 | 4                 | 限时免费                 | 2                 |
  | GLM-4V-Flash             | 4K                | 免费                | 免费                | 限时免费                 | 不支持               |
  | GLM-4.1V-Thinking-FlashX | 64K               | 2                 | 2                 | 限时免费                 | 不支持               |
  | GLM-4.1V-Thinking-Flash  | 64K               | 免费                | 免费                | 限时免费                 | 不支持               |
</Accordion>

### 多模态生成

| 模型名称        | 简介   | 规格   | 单价      | Batch API 定价 |
| ----------- | ---- | ---- | ------- | ------------ |
| GLM-Image   | 图像生成 | 多分辨率 | 0.1 元/次 | 不支持          |
| CogVideoX-3 | 视频生成 | 多分辨率 | 1 元/次   | 不支持          |

<Accordion title="更多多模态生成模型">
  | 模型名称             | 简介    | 规格    | 单价       | Batch API 定价 |
  | ---------------- | ----- | ----- | -------- | ------------ |
  | CogView-4        | 图像生成  | 多分辨率  | 0.06 元/次 | 0.03 元/次     |
  | CogVideoX-2      | 视频生成  | 多分辨率  | 0.5 元/次  | 0.25 元/次     |
  | ViduQ1-Text      | 文生视频  | 1080p | 2.5 元/次  | 不支持          |
  | ViduQ1-Image     | 图生视频  | 1080p | 2.5 元/次  | 不支持          |
  | ViduQ1-Start-End | 首尾帧   | 1080p | 2.5 元/次  | 不支持          |
  | Vidu2-Image      | 图生视频  | 720p  | 1.25 元/次 | 不支持          |
  | Vidu2-Start-End  | 首尾帧   | 720p  | 1.25 元/次 | 不支持          |
  | Vidu2-Reference  | 参考生视频 | 720p  | 2.5 元/次  | 不支持          |
  | CogView-3-Flash  | 图像生成  | 多分辨率  | 免费       | 不支持          |
  | CogVideoX-Flash  | 视频生成  | 多分辨率  | 免费       | 不支持          |
</Accordion>

### 语音模型

| 模型名称          | 简介   | 支持模态  | 单价                                     |
| ------------- | ---- | ----- | -------------------------------------- |
| GLM-TTS       | 语音生成 | 文本    | 2 元/万字符                                |
| GLM-TTS-Clone | 音色克隆 | 文本、音频 | 6 元/次                                  |
| GLM-ASR-2512  | 语音识别 | 音频    | 输入：16 元/百万 Tokens（约 0.0002 元/秒）；输出：不计费 |

<Accordion title="更多语音模型">
  | 模型名称               | 简介    | 支持模态     | 单价                       |
  | ------------------ | ----- | -------- | ------------------------ |
  | GLM-4-Voice        | 语音模型  | 文本、音频    | 80 元/百万 Tokens           |
  | GLM-Realtime-Flash | 实时音视频 | 文本、音频、视频 | 音频：0.18 元/分钟；视频：1.2 元/分钟 |
  | GLM-Realtime-Air   | 实时音视频 | 文本、音频、视频 | 音频：0.3 元/分钟；视频：2.1 元/分钟  |
</Accordion>

### 向量模型

| 模型名称        | 简介 | 上下文长度 | 单价（元/百万 Tokens） | Batch API 定价（元/百万 Tokens） |
| ----------- | -- | ----- | --------------- | ------------------------- |
| Embedding-3 | V3 | 8K    | 0.5             | 0.25                      |
| Embedding-2 | V2 | 8K    | 0.5             | 0.25                      |

### 其他模型

| 模型名称       | 简介    | 上下文长度 | 单价（元/百万 Tokens） |
| ---------- | ----- | ----- | --------------- |
| CodeGeeX-4 | 代码生成  | 128K  | 0.1             |
| Rerank     | 重排序模型 | 4K    | 0.8             |

> Batch API 适用于大规模、非实时数据处理任务。支持 Batch API 的模型可享受标准调用价格的 5 折，具体支持范围和使用方式请参见 [Batch API 使用说明](/cn/guide/tools/batch)。

## 搜索工具服务

搜索工具按照实际调用次数计费。

| 工具名称             | 说明                     | 价格（元/次） |
| ---------------- | ---------------------- | ------- |
| Search-Std       | 智谱自研基础搜索，响应快、性价比高      | 0.01    |
| Search-Pro       | 智谱自研专业搜索，提供更高的搜索结果召回率  | 0.03    |
| Search-Pro-Sogou | 搜狗搜索，处理时间短，支持搜狗百科和搜狗问问 | 0.05    |
| Search-Pro-Quark | 夸克搜索，时效性强，覆盖多个行业领域     | 0.05    |

## 知识库服务

知识库相关服务采用按量后付费模式，根据实际使用量计费。

### 功能计费

| 功能名称           | 具体能力      | 支持范围        | 计费类型 | 价格              |
| -------------- | --------- | ----------- | ---- | --------------- |
| 多模态知识入库        | 文件管理      | 文档、图片、音频、视频 | 单价   | 1 GB 内存储免费      |
| 向量化            | 语义索引      | 文本、图片、音频、视频 | 单价   | 0.5 元/百万 Tokens |
| GLM-rerank-pro | 多模态重排序    | 文本、图片、音频、视频 | 单价   | 0.8 元/百万 Tokens |
| 深度解析           | 文档解析      | PDF 等       | 单价   | 0.12 元/页        |
| 图片理解           | 图像解析      | 图片          | 单价   | 免费              |
| 上下文增强          | 上下文检索补全增强 | 文本          | 单价   | 免费              |

### 容量扩容

知识库扩容根据实际占用容量和使用时长计费。

| 产品名称                | 说明        | 价格           |
| ------------------- | --------- | ------------ |
| knowledge\_capacity | 知识库容量扩容服务 | 0.04 元/GB/小时 |

## 模型微调

BigModel 平台提供 GLM 系列模型训练和部署服务，支持 LoRA 微调和全参数微调。

### 模型训练

| 模型名称        | 训练版本 | LoRA 微调（元/千 Tokens） | 全参数微调（元/千 Tokens） |
| ----------- | ---- | ------------------- | ----------------- |
| GLM-4.5     | 32K  | 0.1                 | 暂不支持              |
| GLM-4.5     | 16K  | 暂不支持                | 0.125             |
| GLM-4.5-Air | 32K  | 0.035               | 0.05              |
| GLM-4-Air   | 8K   | 0.03                | 0.05              |
| GLM-4-AirX  | 8K   | 0.03                | 0.05              |
| GLM-4-Flash | 8K   | 0.025               | 0.04              |
| GLM-4-9B    | 8K   | 0.025               | 0.04              |
| ChatGLM3-6B | 8K   | 0.025               | 暂不支持              |
| CogView-3   | 1K   | 暂不支持                | 0.02              |
| GLM-4V      | 2K   | 0.03                | 暂不支持              |

### 微调模型推理

| 模型名称        | 部署版本      | 公共实例             | 私有实例         |
| ----------- | --------- | ---------------- | ------------ |
| GLM-4-Air   | 8K-int8   | 0.003 元/千 Tokens | 100 元/算力单元/天 |
| GLM-4-AirX  | 8K-int4   | 0.03 元/千 Tokens  | 100 元/算力单元/天 |
| GLM-4-Flash | 8K-int8   | 0.002 元/千 Tokens | 100 元/算力单元/天 |
| GLM-4-9B    | 8K-int8   | 0.002 元/千 Tokens | 100 元/算力单元/天 |
| ChatGLM3-6B | 8K-int8   | 0.002 元/千 Tokens | 暂不支持         |
| CogView-3   | 图像生成-fp16 | 暂不支持             | 100 元/算力单元/天 |
| GLM-4V      | 图像输入-int8 | 暂不支持             | 200 元/算力单元/天 |
| GLM-4-0520  | 8K-int8   | 0.5 元/千 Tokens   | 100 元/算力单元/天 |

## 模型私有实例

模型私有实例适用于对稳定性、推理性能、效果或资源隔离有更高要求的业务。服务按照模型实例占用的算力单元数量和使用天数计费。[咨询方案详情](https://bigmodel.cn/online-book)

> 算力单元是模型私有实例推理服务的最小计费单位。根据模型规格不同，每个模型部署单实例需要占用的算力单元数量不同。

### 语言模型

| 模型名称               | 部署版本      | 私有实例价格       |
| ------------------ | --------- | ------------ |
| GLM-4.6            | 200K-fp8  | 175 元/算力单元/天 |
| GLM-4.5            | 128K-fp8  | 175 元/算力单元/天 |
| GLM-4.5-Air        | 128K-fp8  | 100 元/算力单元/天 |
| GLM-4-Plus         | 8K-int4   | 100 元/算力单元/天 |
| GLM-4-Air-250414   | 128K-int8 | 100 元/算力单元/天 |
| GLM-4-Air          | 8K-int4   | 100 元/算力单元/天 |
| GLM-4-Air          | 128K-int8 | 100 元/算力单元/天 |
| GLM-4-AirX         | 8K-int4   | 100 元/算力单元/天 |
| GLM-4-Flash-250414 | 128K-int8 | 100 元/算力单元/天 |
| GLM-4-Flash        | 8K-int8   | 100 元/算力单元/天 |
| GLM-4-Flash        | 128K-int8 | 100 元/算力单元/天 |
| GLM-4-9B           | 8K-int8   | 100 元/算力单元/天 |
| GLM-4-9B           | 128K-int8 | 100 元/算力单元/天 |

### 视觉模型

| 模型名称                    | 部署版本         | 私有实例价格       |
| ----------------------- | ------------ | ------------ |
| GLM-4.5V                | 图片/视频输入-bf16 | 200 元/算力单元/天 |
| GLM-4.1V-Thinking-Flash | 图片/视频输入-int8 | 100 元/算力单元/天 |
| GLM-4V-Flash            | 图片输入-int8    | 100 元/算力单元/天 |
| GLM-4V                  | 图片输入-int8    | 200 元/算力单元/天 |
| GLM-4V-Plus             | 图片输入-int8    | 200 元/算力单元/天 |
| GLM-4V-Plus             | 视频输入-int8    | 200 元/算力单元/天 |
| GLM-4V-Plus-0111        | 图片输入-int8    | 200 元/算力单元/天 |
| GLM-4V-Plus-0111        | 视频输入-int4    | 200 元/算力单元/天 |

### 图像模型

| 模型名称             | 部署版本        | 私有实例价格       |
| ---------------- | ----------- | ------------ |
| CogView-3        | 图像生成-fp16   | 100 元/算力单元/天 |
| CogView-3-Plus   | 图像生成-int8   | 100 元/算力单元/天 |
| CogView-4-250304 | 基础图像生成-fp16 | 100 元/算力单元/天 |
| CogView-4-250304 | 高清图像生成-fp16 | 100 元/算力单元/天 |

### 视频模型

| 模型名称      | 部署版本      | 私有实例价格       |
| --------- | --------- | ------------ |
| CogVideoX | 文生视频-int8 | 100 元/算力单元/天 |
| CogVideoX | 图生视频-int8 | 100 元/算力单元/天 |

### 向量及其他模型

| 模型名称        | 部署版本    | 私有实例价格       |
| ----------- | ------- | ------------ |
| Embedding-2 | 8K-fp32 | 100 元/算力单元/天 |
| Embedding-3 | 8K-fp16 | 100 元/算力单元/天 |
| Rerank      | 4K-fp32 | 100 元/算力单元/天 |

## 云端私有化套餐

适用于需要长期、稳定使用云端私有实例的企业客户。[咨询方案详情](https://bigmodel.cn/online-book)

| 模型名称        | 套餐包含                                   | 价格       |
| ----------- | -------------------------------------- | -------- |
| GLM-4.5     | 5,840 个算力单元；10 亿 Tokens 训练语料额度；V3 用户权益 | 110 万元/年 |
| GLM-4.5-Air | 5,840 个算力单元；10 亿 Tokens 训练语料额度；V2 用户权益 | 50 万元/年  |

10 亿 Tokens 训练语料额度包括 5 亿 Tokens LoRA 微调额度和 5 亿 Tokens 全参数微调额度。具体赠送权益和适用范围以采购协议为准。

### 增购价格

| 增购项目   | 适用模型或服务    | 价格                                              |
| ------ | ---------- | ----------------------------------------------- |
| 算力单元   | GLM-4-0520 | 60 元/算力单元/天                                     |
| 算力单元   | GLM-4-Air  | 70 元/算力单元/天                                     |
| 训练额度   | GLM-4-0520 | 全参数微调 0.72 元/千 Tokens；LoRA 微调 0.18 元/千 Tokens   |
| 训练额度   | GLM-4-Air  | 全参数微调 0.035 元/千 Tokens；LoRA 微调 0.021 元/千 Tokens |
| 模型微调服务 | 训练咨询       | 10,000 元/人/天                                    |

## 本地私有化解决方案

本地私有化解决方案适用于对数据安全、部署环境和模型运行具有专属要求的企业客户。以下为刊例价格，最终方案和报价以商务沟通为准。

### 模型及一体机

| 模型名称        | 类型   | 刊例价  |
| ----------- | ---- | ---- |
| GLM-4-0520  | 语言模型 | 数千万元 |
| GLM-4-Air   | 语言模型 | 数百万元 |
| GLM-4-Flash | 语言模型 | 数十万元 |
| GLM-4V      | 视觉理解 | 数百万元 |
| CogView-3   | 图像生成 | 数十万元 |

[获取模型及一体机解决方案](https://bigmodel.cn/online-book/deviceLocalDeployment?channel_track_key=deviceLocalDeployment)

### 知识库应用

| 产品版本 | 说明      | 刊例价  |
| ---- | ------- | ---- |
| 专业版  | 专业版检索增强 | 数十万元 |

[获取知识库私有化解决方案](https://bigmodel.cn/online-book/knowledgeLocalDeployment?channel_track_key=knowledgeLocalDeployment)

ChatGLM3-6B、GLM-4-9B 等模型已开放免费商用授权，可[申请授权证书](https://bigmodel.cn/mla/form)。

## 计费常见问题

### 缓存存储如何计费？

缓存存储当前限时免费。本页暂不展示免费期结束后的标准价格，后续如有调整，以页面最新信息为准。

### 如何确认模型当前是否可用？

历史模型价格将继续保留，便于已有业务查询和核对费用。模型当前可用状态、详细说明及接口参数，请参见[模型概览](/cn/guide/start/model-overview)。

### Batch API 如何计费？

支持 Batch API 的模型按照对应标准调用价格的 5 折计费。具体支持范围和使用方式请参见 [Batch API 使用说明](/cn/guide/tools/batch)。

### 实际扣费金额以什么为准？

实际费用根据接口返回的用量数据、调用时适用的按量计费单价以及账户账单计算。如页面价格发生调整，新价格将以页面公告或最新展示为准。

***

[开始使用](https://bigmodel.cn/login) ｜ [联系销售](https://bigmodel.cn/online-book/price?channel_track_key=price)
