中文

改进端到端流式语音识别中的端点检测

计算与语言 2025-05-26 v1 人工智能 声音 音频与语音处理

摘要

ASR 端点检测(EP)在交付良好用户体验方面发挥着主要作用,尤其是在支持人类或人工智能体与人类-人类/人类-机器对话的产品中。基于转换器的 ASR(T-ASR)是流式语音识别中更受偏好的端到端(E2E)ASR 建模技术。T-ASR 的主要局限性是 ASR 输出延迟,这可能导致 EP 错误或延迟。不准确的 EP 会在用户说话时切断用户,导致不完整的转录;而 EP 延迟则会增加感知延迟,损害用户体验。我们提出了方法来改进 EP,通过解决延迟发射问题和 EP 错误。为解决延迟发射问题,我们在每个单词末尾引入一个单词结束标记,并附加延迟惩罚。通过使用辅助网络获取可靠的帧级语音活动检测来解决 EP 延迟。我们在 Switchboard 对话语音语料库上应用所提出的方法,并对其进行评估,与延迟惩罚方法进行比较。

关键词

引用

@article{arxiv.2505.17070,
  title  = {Improving endpoint detection in end-to-end streaming ASR for conversational speech},
  author = {Anandh C and Karthik Pandia Durai and Jeena Prakash and Manickavela Arumugam and Kadri Hacioglu and S. Pavankumar Dubagunta and Andreas Stolcke and Shankar Venkatesan and Aravind Ganapathiraju},
  journal= {arXiv preprint arXiv:2505.17070},
  year   = {2025}
}

备注

Submitted to Interspeech 2024