首页 景点排名文章正文

PolyAI发布原生音频模型,延迟低至300毫秒媲美真人

景点排名 2026年07月31日 11:09 1 admin
PolyAI发布原生音频模型,延迟低至300毫秒媲美真人

语音AI开发商PolyAI今日正式发布Dialog-RSN-1,这是一款能够直接感知并响应音频的原生语音对话大模型。

传统语音AI链路通常串联语音识别、文本大模型及语音合成三个独立环节,易导致信息损耗与延迟。Dialog-RSN-1则在模型内部完成所有语音识别与语义理解,仅将语音输出环节分离。这种架构使AI能一次性“听懂”完整对话,精准捕捉语调、节奏及上下文,无需依赖前置模型。

原生音频理解:捕捉非言语线索

据PolyAI介绍,由于直接解析音频流,新模型能识别改变对话走向的非言语线索。用户可提示模型针对来电者的口音、情绪或环境噪音做出反应。与传统转录丢失信息不同,该模型能结合上下文修正发音错误,例如区分品牌名“Audibel”与普通单词“audible”,或理解用户大声拼写“Matthew有两个T”的意图。

这一机制显著提升了响应速度与交互自然度。模型能在后台快速调用工具并基于全量上下文构建回复,同时通过捕捉用户说话节奏,有效降低不当打断的概率,实现类人的轮流发言体验。

性能对比:延迟远低于行业标杆

数据显示,Dialog-RSN-1的延迟区间为280至500毫秒,并能稳定在300毫秒内响应。相比之下,OpenAI的GPT-realtime-2.1响应延迟通常在860至1900毫秒之间。

人类正常对话的自然停顿约为200至300毫秒,且跨文化、语言具有高度一致性。AI响应若偏离此时机,易引发用户挫败感,尤其在用户试图打断纠错时,高延迟会导致沟通效率大幅降低。

架构解耦:灵活控制语音输出

PolyAI刻意将文本转语音(TTS)模块从大模型中剥离。这意味着最终用户可独立调整声音音色、情感色彩及节奏,无需对底层对话模型进行昂贵且复杂的重新训练。

这与GPT-realtime和Gemini Live等内置语音输出的模型形成鲜明对比。后者难以大规模定制声音且流媒体成本高昂。而Dialog-RSN-1的解耦架构允许企业在专用硬件上高效运行TTS,自主控制资源投入,从而降低整体计算成本。

技术层面,PolyAI利用内部数据,通过监督微调和强化微调对开放权重的多模态模型进行后训练。其训练管道兼容Gemma、GPT-OSS、Qwen和Mistral等多种基座。公司的目标是在A100 GPU上部署8B密集或30B稀疏模型时,将延迟控制在300毫秒以下。

【星途科讯 图文丨踢三脚 首发于ZAKER科技,转载请注明出处】

发表评论

长征号 Copyright © 2013-2024 长征号. All Rights Reserved.  sitemap