中文

Mondegreen:一种用于语音搜索查询的语音识别错误纠正后处理方案

声音 2021-05-21 v1 计算与语言 机器学习 音频与语音处理

摘要

随着越来越多的在线搜索查询来自语音,自动语音识别成为提供相关搜索结果的关键组件。自动语音识别(ASR)引入的错误会导致返回给用户不相关的搜索结果,从而引起用户不满。在本文中,我们引入一种名为 Mondegreen 的方法,在文本空间中纠正语音查询,而不依赖于音频信号——由于系统限制或隐私或带宽(例如,某些 ASR 系统在设备端运行)考虑,音频信号未必总可用。我们关注通过若干专有商业 ASR 系统转写的语音查询。这些查询来自进行互联网或在线服务搜索的用户。我们首先给出一项分析,展示用户语音查询的语言分布与用于训练现成 ASR 系统的传统文本语料库之间的差异。随后我们证明,在 Google 最大的搜索系统之一中,Mondegreen 可通过纠正用户语音查询显著提升用户交互。最后,我们将 Mondegreen 视为对现有高度优化的生产型 ASR 系统的补充,这些系统可能不经常重新训练,因而因词汇漂移而落后。

关键词

引用

@article{arxiv.2105.09930,
  title  = {Mondegreen: A Post-Processing Solution to Speech Recognition Error Correction for Voice Search Queries},
  author = {Sukhdeep S. Sodhi and Ellie Ka-In Chio and Ambarish Jash and Santiago Ontañón and Ajit Apte and Ankit Kumar and Ayooluwakunmi Jeje and Dima Kuzmin and Harry Fung and Heng-Tze Cheng and Jon Effrat and Tarush Bali and Nitin Jindal and Pei Cao and Sarvjeet Singh and Senqiang Zhou and Tameen Khan and Amol Wankhede and Moustafa Alzantot and Allen Wu and Tushar Chandra},
  journal= {arXiv preprint arXiv:2105.09930},
  year   = {2021}
}

备注

Accepted in KDD 2021