7月29日,Fish Audio周年发布S2.1Pro实时对话语音模型,首帧延迟约90ms,支持83种语言、5秒声音克隆,以及通过括号标签在文本任意位置实现逐词......
7月20日,阿里千问发布语音合成大模型Qwen-Audio-3.0-TTS。Flash版首包延迟300ms,Plus版支持48kHz高清输出与3分钟长文本合成。......
7月20日,阿里通义千问发布语音合成大模型Qwen-Audio-3.0-TTS。Flash版首包延迟300ms,Plus版支持48kHz高清输出与3分钟长文本合......