中文

易于轮次:整合声学与语言模态以实现全双工对话系统的稳健轮次检测

计算与语言 2025-09-30 v1 人工智能

摘要

全双工交互对于自然的人机沟通至关重要,但仍然具有挑战性,因为它需要可靠的轮次检测来决定系统应在何时发言、倾听或保持沉默。现有解决方案要么依赖专门的轮次检测模型,大多数模型未开源;少数可用模型受限于参数规模大或仅支持单一模态,如声学或语言。或者,一些方法微调LLM作为全双工能力的 backbone,但需要大量的全双工数据,而这些数据在开源形式下稀缺。为解决这些问题,我们提出Easy Turn,一个开源、模块化的轮次检测模型,整合声学和语言双模态信息,用于预测四种对话轮次状态:完成、不完整、背通和等待,并随意发布Easy Turn训练数据集,该数据集设计用于训练轮次检测模型。与现有的开源模型如TEN轮次检测和Smart Turn V2相比,我们的模型在我们开源的Easy Turn测试集上实现了最先进的轮次检测准确率。该数据和模型将在GitHub上公开。

关键词

引用

@article{arxiv.2509.23938,
  title  = {Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems},
  author = {Guojian Li and Chengyou Wang and Hongfei Xue and Shuiyuan Wang and Dehui Gao and Zihan Zhang and Yuke Lin and Wenjie Li and Longshuai Xiao and Zhonghua Fu and Lei Xie},
  journal= {arXiv preprint arXiv:2509.23938},
  year   = {2025}
}