RelayS2S:用于实时对话的双路径推测生成
人工智能
2026-03-25 v1
摘要
实时语音对话系统面临延迟与响应质量之间的根本性权衡。端到端语音转语音(S2S)模型响应即时,自然处理轮流发言、回应和打断,但产生语义较弱的输出。级联流水线(ASR → LLM)以延迟随模型规模增大为代价提供更优的响应。我们提出了 RelayS2S,一种在检测到轮次切换时并行运行两条路径的混合架构。快速路径——一个全双工 S2S 模型——推测性地起草一个短响应前缀,立即流式传输给 TTS 以实现低延迟音频起始,同时持续监控实时音频事件。慢速路径——一个级联 ASR → LLM 流水线——基于已确认的前缀生成更高质量的延续部分,产生无缝的语音输出。一个轻量级学习验证器控制交接过程,在适当时候确认前缀或优雅地回退到仅使用慢速路径。实验表明,RelayS2S 实现了与 S2S 模型相当的 P90 起始延迟,同时保留了 99% 的级联响应质量(平均分),且随着慢速路径模型规模的扩大优势更加明显。由于前缀交接无需对任一组件进行架构修改,RelayS2S 可作为现有级联流水线的轻量级即插即用补充。我们的代码和数据公开可用:https://github.com/mailong25/relays2s
引用
@article{arxiv.2603.23346,
title = {RelayS2S: A Dual-Path Speculative Generation for Real-Time Dialogue},
author = {Long Mai},
journal= {arXiv preprint arXiv:2603.23346},
year = {2026}
}