MoshiRAG:面向全双工语音语言模型的异步知识检索
计算与语言
2026-05-13 v3 音频与语音处理
摘要
语音到语音语言模型最近出现,以增强对话式AI的自然性。特别是,全双工模型以其实时交互性而著称,包括处理停顿、打断和反馈。然而,提高其事实准确性仍然是一个开放的挑战。虽然扩大模型规模可以解决这一差距,但这将使实时推理成本过高。在这项工作中,我们提出了MoshiRAG,一种模块化方法,它将紧凑的全双工接口与选择性检索相结合,以访问更强大的知识源。我们的异步框架使模型能够识别知识密集型查询,并将其响应建立在外部信息之上。通过利用响应开始与核心信息传递之间的自然时间间隔,检索过程可以在保持自然对话流程的同时完成。通过这种方法,MoshiRAG实现了与公开的最佳非双工语音语言模型相当的事实准确性,同时保留了全双工系统固有的交互性。此外,我们灵活的设计支持即插即用的检索方法而无需重新训练,并在域外数学推理任务上表现出强大的性能。
引用
@article{arxiv.2604.12928,
title = {MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models},
author = {Chung-Ming Chien and Manu Orsini and Eugene Kharitonov and Neil Zeghidour and Karen Livescu and Alexandre Défossez},
journal= {arXiv preprint arXiv:2604.12928},
year = {2026}
}
备注
Accepted to ICML 2026