中文

FastTurn:统一声学与流式语义线索用于低延迟和稳健的语音检测

声音 2026-04-28 v4 音频与语音处理

摘要

最近的 AudioLLM 进展使口语对话系统得以超越基于语音的交互,走向实时全双工通信,代理必须在用户仍在说话时决定何时发言、让渡或中断。现有的全双工方法要么依赖语音活动线索,缺乏语义理解;要么依赖基于 ASR 的模块,引入延迟并在重叠语音和噪声下性能下降。此外,可用数据集很少捕获真实的交互动态,限制了评估和部署。为缓解此问题,我们提出了 FastTurn,一个用于低延迟和稳健语音检测的统一框架。为在保持性能的同时推进延迟,FastTurn 将流式 CTC 解码与声学特征结合, enable 从部分观察中做出早期决定,同时保留语义线索。我们也发布了一个基于真实人类对话的测试集,捕获真实的语音转换、重叠语音、后话、停顿、音高变化和环境噪声。实验表明,FastTurn 在代表性基准中实现更高的决策准确性和更低的中断延迟,能够在具有挑战性的声学条件下保持稳健性,展示了其在实际全双工对话系统中的有效性。

关键词

引用

@article{arxiv.2604.01897,
  title  = {FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection},
  author = {Chengyou Wang and Hongfei Xue and Chunjiang He and Jingbin Hu and Shuiyuan Wang and Bo Wu and Yuyu Ji and Jimeng Zheng and Ruofei Chen and Zhou Zhu and Lei Xie},
  journal= {arXiv preprint arXiv:2604.01897},
  year   = {2026}
}

备注

5 pages, 2 figures