Zhipu AI
Z.ai 的音频与实时多模态 API 家族,包含 GLM-TTS、音色克隆、ASR、Realtime 和 GLM-4-Voice。
快速结论
音频已经是文档化的 GLM 能力家族,应在音频分类中可见。
BigModel 模型概览在音视频模型下列出 GLM-TTS、GLM-TTS-Clone、GLM-ASR、GLM-Realtime 和 GLM-4-Voice,覆盖语音合成、音色克隆、语音识别和实时音视频交互。
专题指南基于来源梳理原始 GLM-5.3、开放多模态 GLM-5.3-Flash、GLM-5.2、BigModel API、Coding Plan、ZCode、消费者 Agent 和媒体产品。
编辑结论
适合评估中国语音、音色克隆、ASR 和实时多模态 API 的开发者。
未完成授权和数据保留审查前,不应生产使用音色克隆。
音频已经是文档化的 GLM 能力家族,应在音频分类中可见。
Usage-based audio API pricing varies by model
Free model where available, Platform billing
商用应遵守当前产品、API、模型许可证和计费条款。
处理敏感负载前,请核验提示词、文件、媒体上传、保留和训练使用条款。
用于测试 TTS、音色克隆、ASR 和实时音视频调用。
模型名称、额度、发布状态、区域接入和商用条款变化较快,采购或生产使用前请重新核验官方来源。
minimax-audio
sparkdesk
zhipu-glm
文档 · ZH · 核验于 2026-08-04
列出 GLM-TTS、GLM-TTS-Clone、GLM-ASR、GLM-Realtime 和 GLM-4-Voice。
最后核验: 2026-08-04
暂无已审核的评论。