Skip to main content

概览

GLM-TTS 语音合成模型以新一代智谱语音大模型为核心,突破传统语音合成框架,通过上下文智能预判文本情绪与语调,显著提升语音自然度与表现力,让合成语音具备真实情感与生命力。GLM‑TTS 在架构上采用两阶段生成,并在训练中引入基于 GRPO 的强化学习方案,在公开评测的「字错误率」和「情感表达」上取得开源 SOTA 表现。

输入模态

文本

输出模态

音频
模型价格详情请前往价格界面!

推荐场景

智能客服

全链路柔性服务,降低用户抵触感。依托超拟人语音的情感适配与自然对话能力,覆盖客服全场景。
沉浸式 “解放双眼”,适配多元需求。突破传统 “听书” 局限,以超拟人语音的 “角色化演绎 + 情感随内容动态调整” 能力,打造个性化阅读体验。
通过超拟人语音的真实情感衔接与场景化语调调整,让智能硬件摆脱 “工具属性”。
场景化教学,提升学习沉浸感。
高效信息传递,解放双手。会议纪要转语音、邮件 / 文档播报、智能待办提醒。
沉浸式体验,替代 “传统导游”,如景区智能导览、酒店智能服务、文旅内容科普。

使用资源

体验中心

快速测试模型在业务场景上的效果

接口文档

API 调用方式

详细介绍

GLM-TTS 结合了 text2token 大语言模型和 token2wav 扩散模型,突破传统语音合成框架。相比传统技术,GLM-TTS 在口语自然度、拟人化还原、语句衔接和韵律节奏上全面升级,尤其在情感表达上精准呈现,为客户打造生动、富感染力的听觉体验,实现从“清晰传递”到“情感共鸣”的跨越。

可选音色

应用示例

调用示例

基础调用
流式调用及响应示例
异常调用示例