中文

面向语音对话系统的预测性语音识别与语音结束检测

音频与语音处理 2024-10-01 v1 计算与语言 声音

摘要

有效的语音对话系统应 Facilitate natural interactions with quick and rhythmic timing,以模拟人类交际模式。为降低响应延迟,此前的研究聚焦于最小化自动语音识别 (ASR) 的延迟以优化系统效率。然而,这种方法需要等待 ASR 完成处理才能确定说话者已结束发言,这限制了自然语言处理 (NLP) 制定准确响应的时间。人类在对方仍在发言时即可持续预测并准备响应,这使我们能够在不错失最佳发言时机的情况下进行恰当的回应。本研究旨在构建一种模拟此类人类预测行为的对话系统功能,能够利用语音中间的部分预测未来单词并估计语音结束 (EOU) 的剩余时间。为实现此目标,我们提出一种基于编码器-解码器的 ASR 系统训练策略,通过掩码未来语音片段并引导解码器预测被掩码音频中的单词。此外,我们开发一种基于跨注意力的算法,融合声学与语言信息,准确检测 EOU。实验结果表明,所提模型能够在实际 EOU 之前预测未来单词并估计 EOU 事件,最高可达实际 EOU 前 300ms。此外,所提训练策略还能在 ASR 性能上实现一般性提升。

关键词

引用

@article{arxiv.2409.19990,
  title  = {Predictive Speech Recognition and End-of-Utterance Detection Towards Spoken Dialog Systems},
  author = {Oswald Zink and Yosuke Higuchi and Carlos Mullov and Alexander Waibel and Tetsunori Kobayashi},
  journal= {arXiv preprint arXiv:2409.19990},
  year   = {2024}
}

备注

Submitted to ICASSP2025