语义感知式语音对话系统中的中断检测:基准、指标与模型
声音
2026-03-26 v1 音频与语音处理
摘要
在语音对话系统(SDS)中实现自然的全双工交互仍然具有挑战性,原因在于准确检测用户中断存在困难。当前解决方案在“触发频繁”的基于VAD的方法与具有不可接受响应延迟的鲁棒端到端模型之间呈现两极分化。此外,缺乏真实世界基准和全面指标阻碍了该领域的进步。本文提出了一个全面的框架来克服这些限制。我们首先引入SID-Bench,第一个完全基于真实世界人类对话构建的语义感知式中断检测基准。为了提供对响应-稳健性权衡的严格评估,我们提出了平均惩罚时间(Average Penalty Time, APT)指标,对假阳性和迟延响应都赋予时间成本。基于此框架,我们设计了一个通过新颖训练范式优化的LLM-based检测模型,以捕捉意图细微语义线索。实验结果显示,我们的模型显著优于主流基线,APT降低了近三倍。通过成功解决长期存在的速度与稳健性之间的紧张关系,本工作为SDS中的智能中断处理建立了新的最佳实践。为促进未来研究,SID-Bench及其相关代码均可在 https://github.com/xkx-hub/SID-bench 获取。
引用
@article{arxiv.2603.24144,
title = {Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model},
author = {Kangxiang Xia and Bingshen Mu and Xian Shi and Jin Xu and Lei Xie},
journal= {arXiv preprint arXiv:2603.24144},
year = {2026}
}
备注
Accepted by ICME 2026