中文

语音搜索错误纠正的声学增强判别性 rescoring

计算与语言 2025-06-09 v1 人工智能 信息检索

摘要

端到端(E2E)自动语音识别(ASR)模型是使用成本高昂的配对音频-文本样本进行训练的,后者需要人工标注员提供高质量的ground-truth数据。语音搜索应用(如数字媒体播放器)利用ASR允许用户通过语音进行搜索,而非使用屏幕键盘。然而,近期或不频繁出现的电影标题可能在E2E ASR系统的训练数据中代表不足,因而 suffer poor recognition。本文提出了语音纠正系统,包括(a)基于ASR模型输出的语音搜索,以生成ASR系统可能不考虑的语音备选方案;以及(b)rescorer组件,将ASR模型识别与语音备选方案组合,并选择最终系统输出。我们发现,我们的方法在流行电影标题的benchmark上相对于一系列竞争性baseline实现了4.4%至7.6%的相对词错误率(word error rate)改进。

关键词

引用

@article{arxiv.2506.06117,
  title  = {Phonetically-Augmented Discriminative Rescoring for Voice Search Error Correction},
  author = {Christophe Van Gysel and Maggie Wu and Lyan Verwimp and Caglar Tirkaz and Marco Bertola and Zhihong Lei and Youssef Oualil},
  journal= {arXiv preprint arXiv:2506.06117},
  year   = {2025}
}

备注

To appear at Interspeech '25