Meituan LongCat
LongCat-AudioDiT 是美团 LongCat 团队发布的开源权重扩散式文本转语音模型。仓库和论文将其描述为非自回归 TTS 系统,直接在 waveform latent space 上工作,而不是使用 mel-spectrogram,从而减少流水线复杂度和误差累积。推理路径结合 waveform VAE 和 diffusion backbone,修正训练-推理不一致,并使用 adaptive projection guidance 替代传统 classifier-free guidance。仓库公开代码和模型权重供研究使用,提供 Hugging Face 兼容实现和推理脚本,并在 Seed benchmark 上报告了零样本文本语音克隆的 SOTA 结果。最大的 LongCat-AudioDiT-3.5B 模型据称在 Seed-ZH 和 Seed-Hard 上的 speaker similarity 优于此前的 Seed-TTS 基线。
编辑结论
适合评估开源 TTS、waveform-latent diffusion 和零样本语音克隆的研究者与语音团队。
在验证运行时、权利和部署约束前,不应把它当成开箱即用的生产语音平台。
LongCat-AudioDiT 应归入 AI 音频,因为它是公开代码和权重的 TTS / 语音克隆模型,而不只是普通论文。
Open-source MIT repository and released model weights; inference runs locally or through a Hugging Face-compatible workflow
GitHub repository, Model weights download, Local inference, Hugging Face-compatible workflow
仓库采用 MIT,但声音克隆权利、模型权重和生成音频使用仍需明确审查。
生产使用前应核验提示音频处理、保留的声音样本和生成音频存储。
当需要用提示音频加文本复现说话人风格和相似度时评估。
适合对比 Seed-TTS、CosyVoice、Qwen3-TTS 和 MiniMax 语音基线。
可利用模型和脚本研究 waveform-latent diffusion 推理和 guidance 方法。
minimax-audio
stepaudio
qwen-audio
zhipu-glm-audio
official · en · verified 2026-08-04
确认仓库名称、MIT 许可证、模型描述、Seed benchmark 结果、代码与权重发布和推理用法。
docs · en · verified 2026-05-18
用于 waveform-latent diffusion、APG guidance 和测试声明的论文来源。
最后核验: 2026-08-04