LLM 在说话时应当如何倾听?全双工语音对话中用户流路由研究
计算与语言
2026-05-12 v1 音频与语音处理
摘要
全双工语音对话要求模型在生成自身语音响应的同时保持倾听。这对于大语言模型 (LLM) 构成了挑战,因为其设计旨在扩展单一连贯序列,且天然不支持生成期间到达的用户输入。因此,我们主张用户流如何路由至 LLM 是全双工建模的关键架构问题。为研究此问题,我们将纯文本 LLM 扩展为统一的全双工语音对话系统,并在共享训练流程下比较两种路由策略:(i) 通道融合,将用户流直接注入 LLM 输入;(ii) 交叉注意力路由,将用户流保留为通过交叉注意力适配器访问的外部记忆。在语音问答与全双工交互基准上的实验揭示了明确的权衡。通道融合产生了更强的语义基础,并在问答性能上持续表现更佳。然而,在用户打断等语义重叠条件下,它更容易受到上下文破坏的影响:若模型未能及时停止,重叠的用户流会干扰正在进行的生成,导致语义不连贯的续写。交叉注意力路由在问答上表现欠佳,但能更好地保留 LLM 生成上下文,且对此失效模式更具鲁棒性。这些结果确立了用户流路由作为全双工语音对话中的核心设计轴,并为语义集成与上下文鲁棒性之间的权衡提供了实践指导。我们提供了用于定性检查的演示页面。
引用
@article{arxiv.2605.10199,
title = {How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue},
author = {Hui Lu and Xueyuan Chen and Huimeng Wang and Shuhai Peng and Shiyin Kang and Xixin Wu and Zhiyong Wu},
journal= {arXiv preprint arXiv:2605.10199},
year = {2026}
}