NetEase Youdao
Confucius4-TTS 是网易有道开源的基于大语言模型的文本转语音系统,面向多语种和跨语种语音合成。仓库描述其采用语音编码器加大语言模型架构,可在跨语言生成时保持说话人音色一致。它支持中文、英文、日语、韩语、德语、法语、西班牙语、印尼语、意大利语、泰语、葡萄牙语、俄语、马来语和越南语。公开发布重点包括无需参考文本的无约束声音克隆、跨语种声音迁移、零样本声音迁移、情感迁移、在线 Demo、Hugging Face 与 ModelScope 模型下载、Python 推理,以及分为 Text2Semantic 和 Semantic2Acoustic 两个模块的训练路径。
编辑结论
适合评估开源多语种 TTS、跨语种配音、零样本声音克隆和情感保留声音迁移的语音研究者与本地化团队。
如果需要托管语音 API、开箱即用商用权利、低资源 CPU 推理,或没有明确授权的声音克隆,就不适合直接使用。
Confucius4-TTS 应归入 AI 音频,因为它是带模型下载、推理代码和基准结果的开源 TTS 与声音克隆引擎。
Apache-2.0 open-source repository with Hugging Face and ModelScope model downloads; local CUDA inference required
GitHub repository, Hugging Face model download, ModelScope model download, Online demo, Local CUDA inference
商用应遵守当前产品、API、模型许可证和计费条款。
处理敏感负载前,请核验提示词、文件、媒体上传、保留和训练使用条款。
在 14 种支持语言中合成语音,同时保持同一说话人音色。
使用参考音频提示克隆声音,无需额外训练或参考文本。
可按 Text2Semantic 与 Semantic2Acoustic 训练路径,用 TSV 数据进行本地实验。
模型名称、额度、发布状态、区域接入和商用条款变化较快,采购或生产使用前请重新核验官方来源。
longcat-audiodit
minimax-audio
stepaudio
qwen-audio
mimo-speech
official · en · verified 2026-08-04
确认多语种零样本 TTS 定位、14 种语言、在线 Demo、安装、推理、微调、基准结果和 Apache-2.0 仓库许可证。
other · en · verified 2026-06-25
官方 README 将此链接作为 Hugging Face 模型入口。
最后核验: 2026-08-04