MiniMax
MiniMax Audio 覆盖 Speech 2.8、Speech 2.6 和 Speech-02 模型、40 种语言语音合成、HTTP/WebSocket 同步 TTS、异步长文本 TTS、声音克隆和官方声音管理 API。Speech 2.8 新增原生 Sound Tags,可表现呼吸、停顿、犹豫、轻笑等声音动作;支持用 10 秒样本进行更高保真克隆,并减少背景噪声和数字伪影。MiniMax 还记录了中日语对跨语言发音和口音串扰的改善。
编辑结论
适合评估中国语音合成、声音克隆和多语言音频生成 API 的团队。
没有清晰授权、数据和商用审查前,不应在生产中使用克隆声音。
MiniMax Audio 值得单独成档,因为官方 API 文档覆盖了聊天模型之外较完整的语音产品线。
Speech 2.8 Turbo $60/M characters; HD $100/M characters; rapid cloning $1.50/voice; voice design $3/voice
Audio Subscription, Token Plan, Credits, Pay-as-you-go API billing
声音克隆、合成声音和生成音频使用需按当前授权和产品条款核验。
使用真人声音前,应核验上传语音样本、克隆声音保留和生成音频存储规则。
可用 Speech 2.8 或 2.6 评估多语言 TTS、语音聊天和在线社交场景。
异步 TTS 适合书籍或长文档等长音频任务。
声音克隆和声音设计应在法律与授权核验后使用。
可用原生 Sound Tags 为助手、角色和旁白加入呼吸、犹豫、轻笑与节奏提示。
可在重视减少口音串扰和发音偏移的中日语音迁移场景中评估。
已于 2026 年 6 月 21 日核验。生产使用前请重新核验模型 ID、Sound Tag 语法、支持语言、声音克隆要求、授权控制和订阅额度。
API Platform 档案覆盖计费、Key 和跨模态集成。
星火是中国语音和垂直场景的参考。
official · en · verified 2026-06-21
确认原生 Sound Tags、10 秒高保真克隆、噪声与伪影减少、中日跨语言改善,以及通过 MiniMax Audio 和 Open Platform 提供。
最后核验: 2026-08-04