首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放
近日,阿里通义千问团队正式发布新一代实时语音合成模型Qwen-Audio-3.0-TTS。其Plus版本已在全球权威榜单Artificial Analysis的Speech Arena中斩获全球第一。本次发布包含双版本:Flash版主打实时交互,首包延迟约300ms,适配智能助手等低延时场景;Plus版聚焦高质量生成。核心能力实现四大突破:一是多语种与方言覆盖升级,支持16种语言,Plus版在全部16种语言上的平均说话人相似度达82.75;同时支持20种中文方言。二是支持Free-style自然语言指令,用“温柔客服语气”“带货主播风格”等自然语言即可生成对应语音。三是细粒度标签控制,支持[gasp]、[angry]等结构化标签,可调控呼吸、笑声等非语言细节。四是复杂声学鲁棒性强,即便参考音频存在高噪声、高混响,也能自动过滤杂音、保留音色。配套精品音色库覆盖指令、方言、小语种等多类音色,支持48K高清音频输出(预计7月24日开放),单次合成最长支持3分钟长文本。目前模型已在阿里云百炼平台全面开放,开发者可接入体验。