跳到主要内容
Chinese AI Tools
产品模型库集成生态榜单最新变化
专题全球可用性使用场景提交工具账号
EN搜索

Chinese AI Tools

独立的中国 AI 产品目录。产品可用性、价格和条款可能变化,商用前请再次核验。

编辑标准认领产品更新资料申请推荐投放合作

Alibaba Cloud

Qwen Audio / CosyVoice

Qwen Cloud 的语音栈,覆盖文本转语音、声音克隆、语音识别和实时多模态语音。

全球可用完整英文界面公开 API免费增值

快速结论

Qwen Cloud 已有足够官方音频证据,值得单独放入音频分类。

官方网站文档
价格
Free tier and pay-as-you-go speech API billing vary by model
可用性
全球可用
API
公开 API
最后核验
2026-08-04
价格详情适用场景来源证据

Qwen Cloud 列出 CosyVoice-v3-plus 高质量语音合成和声音克隆、Qwen3-ASR-Flash-Realtime 多语言实时语音识别,文档还列出 Qwen3.5-Omni-Flash-Realtime 实时多模态语音对话。

专题指南

Qwen 模型、编程与多模态生态

基于来源梳理 Qwen3.8 与 Qwen3.7 模型、开放权重、Qwen Cloud API、Qwen Code、Token Plan 和多模态产品。

编辑结论

适合

适合通过英文平台评估中国语音合成、声音克隆、ASR 和实时语音 API 的团队。

谨慎使用

未明确授权和核验保留规则前,不应生产使用克隆声音。

核心原因

Qwen Cloud 已有足够官方音频证据,值得单独放入音频分类。

可信度: 2/2 个来源已核验,且最近核验覆盖度: 100/100

价格

Free tier and pay-as-you-go speech API billing vary by model

支付方式

Qwen Cloud billing, Token Plan where supported, Pay-as-you-go API billing

商业使用

商用应遵守当前产品、API、模型许可证和计费条款。

隐私

处理敏感负载前,请核验提示词、文件、媒体上传、保留和训练使用条款。

适用场景

文本转语音与声音克隆

强

使用 CosyVoice 评估专业语音合成和自定义声音生成。

实时多语言 ASR

强

使用 Qwen3-ASR-Flash-Realtime 进行多语言语音识别测试。

全球用户决策清单

注册已确认Qwen Cloud 英文模型市场和文档列出音频条目。
英文界面已确认模型市场和文档面向英文用户。
API 与文档已确认文档包含 TTS、ASR 和语音到语音模型分类。
商用需核验声音克隆、合成语音和录音需要授权与政策审查。

模型名称、额度、发布状态、区域接入和商用条款变化较快,采购或生产使用前请重新核验官方来源。

优点

  • - TTS、声音克隆、ASR 和实时语音分类均有文档
  • - 英文模型市场可见 CosyVoice 和 Qwen3-ASR

缺点

  • - 声音克隆需要授权和数据处理审查

替代决策路径

minimax-audio

zhipu-glm-audio

sparkdesk

来源

Qwen Cloud model marketplace

官方 · EN · 核验于 2026-08-04

列出 CosyVoice-v3-plus 和 Qwen3-ASR-Flash-Realtime。

Qwen Cloud model selection

文档 · EN · 核验于 2026-05-17

列出文本转语音、语音转文本和语音到语音分类。

最后核验: 2026-08-04

评论

暂无已审核的评论。

可用性概览

可用性
全球可用
英文界面
完整英文界面
API
公开 API
评分
4.2 (0)

最新动态

最新变化
开源 · 2026-06-21

Qwen 研究索引已纳入官方来源

Qwen 官方研究索引目前公开 60 条发布、开源和研究内容,覆盖语言模型、代码、视觉、图像生成与编辑、语音、全模态系统、向量、智能体、安全和训练方法;该索引现已作为跟踪 Qwen 模型家族的重要一手来源。

开源 · 2026-06-17

Confucius4-TTS 多语种零样本 TTS 档案已新增

网易有道 Confucius4-TTS 已收录到 AI 音频,作为 Apache-2.0 开源的多语种、跨语种零样本 TTS 引擎跟踪。档案记录其语音编码器加 LLM 架构、14 种支持语言、无需参考文本的无约束声音克隆、跨语种声音迁移、情感迁移、在线 Demo、Hugging Face 与 ModelScope 模型入口、Python 推理、微调流程和基准来源。

开源 · 2026-05-18

LongCat-AudioDiT 开源权重 TTS 档案已新增

已将 LongCat-AudioDiT 收录到 AI 音频,作为美团 LongCat 开源的扩散式 TTS 与语音克隆模型跟踪,覆盖 waveform-latent 生成、APG guidance、零样本克隆、Seed 测试结果以及 GitHub / PDF 来源。

市场 · 2026-05-17

Qwen Cloud 国际模型市场已扩展

已按 Qwen Cloud 补充 Qwen 国际模型市场,覆盖 Qwen3.6 文本与视觉、Qwen-Image/Wan 图像、Wan/HappyHorse 视频、CosyVoice/Qwen ASR 音频、向量/重排序和 Token Plan。

提交评论