中文

基于神经音频编解码器和标签延迟训练的语音对话流式端点检测器

声音 2025-06-23 v2 音频与语音处理

摘要

准确且低延迟的端点检测对于有效的语音对话系统至关重要。虽然传统端点检测器常依赖于谱基的音频特征,但本工作提出了针对多轮对话的实时语音端点检测,采用流式低比特率神经音频编解码器(Neural Audio Codec, NAC)特征,基于近期神经音频编解码器的最新进展。为进一步减少截断错误,我们引入一种新颖的标签延迟训练方案。在固定中位数延迟为 160 ms 的情况下,我们结合 NAC 和标签延迟方法实现了显著的相对截断错误降低:对于单流端点检测器为 42.7%,对于双流配置为 37.5%。最后,我们演示了与基于编解码器的预训练语音大语言模型的高效集成,使其中位数响应时间改进 1200 ms,截断错误降低 35%。

关键词

引用

@article{arxiv.2506.07081,
  title  = {Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training},
  author = {Sathvik Udupa and Shinji Watanabe and Petr Schwarz and Jan Cernocky},
  journal= {arXiv preprint arXiv:2506.07081},
  year   = {2025}
}