StepFun
StepAudio 覆盖阶跃星辰的音频模型。英文文档将 StepAudio 2.5 TTS 定位为上下文语音合成模型,支持自然语言控制、情绪弧线和约 3 秒参考音频的零样本声音克隆;同时列出 step-tts-2、step-tts-mini、用于流式/近实时转写的 stepaudio-2.5-asr,以及 32B ASR Pro 模型 stepaudio-2-asr-pro。
编辑结论
适合评估中国语音 API 的团队,尤其是表现力 TTS、声音克隆、配音、客服、NPC 对话和转写。
如果没有测试注册、授权处理和限流,就需要完全验证的国际音频工作流,不应直接采用。
StepAudio 是独立能力线,应在 AI Audio 分类中可见,而不是埋在通用 StepFun 档案里。
stepaudio-2.5-tts $0.85 / 10,000 characters; step-tts-2 $0.40 / 10,000 characters; ASR $0.022 / hour; voice cloning $1.50 / voice
Open Platform balance, Step Plan quota for supported audio models
商用应遵守阶跃星辰音频 API 条款和声音克隆授权要求。
声音克隆和转写可能涉及生物特征或敏感音频;需核验授权、留存和数据处理条款。
可用上下文 TTS 做有声书、短剧配音、广告旁白和情绪叙事。
可用 stepaudio-2.5-asr 做字幕、语音输入、会议转写和后端批处理。
音频文档明确提到游戏 NPC 作为音频驱动体验用例。
minimax-audio
qwen-audio
zhipu-glm-audio
seeduplex-audio
最后核验: 2026-08-04