SALMONN-omni:无音频编解码器的独立语音大语言模型用于全双工对话
计算与语言
2025-05-26 v1 人工智能
摘要
为了实现流畅自然的人机语音交互,现有全双工对话系统常采用模块化架构,包含语音活动检测器、抢话器、对话状态预测器或多个 LLM。但这些系统存在模块间误差累积,难以应对上下文相关抢话和回声消除等关键挑战。最近方法(如 Moshi)通过将音频编解码器注入单个 LLM 的 token 空间来简化流程。然而,这些方法在语音模态下仍会出现显著性能下降。本文介绍 SALMONN-omni,首个无需在 token 空间中包含音频编解码器的独立全双工语音 LLM。其在 LLM 主干中引入新颖的动态思考机制,使模型能够学习何时在说话和倾听状态之间转换。在用于 spoken question answering 和 open-domain dialogue 的广泛基准测试上,SALMONN-omni 相比现有开源全双工模型至少提升30%,且在使用大幅减少训练数据的情况下,表现优于半双工和轮次制系统。此外,SALMONN-omni 在包含 turn-taking、backchanneling、echo cancellation 和 context-dependent barge-in 的复杂对话场景中表现突出,经强化学习后进一步提升。本仓库提供了用户与 SALMONN-omni 的演示对话:https://github.com/bytedance/SALMONN
引用
@article{arxiv.2505.17060,
title = {SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation},
author = {Wenyi Yu and Siyin Wang and Xiaoyu Yang and Xianzhao Chen and Xiaohai Tian and Jun Zhang and Guangzhi Sun and Lu Lu and Yuxuan Wang and Chao Zhang},
journal= {arXiv preprint arXiv:2505.17060},
year = {2025}
}