中文

使用简单 N-best 重排序提升野生环境中的多语言语音识别

计算与语言 2024-09-30 v1 声音 音频与语音处理

摘要

多语言语音识别(ASR)模型通常在已知语音言语语言的语境中进行评估,但实际情况下这种情况往往不成立。自动语音语言识别(SLID)模型并非完美,误分类会对最终 ASR 准确率产生显著影响。本文提出一种简单且有效的 N-best 重排序方法,通过利用语言模型和基于文本的语言识别模型等外部特征,提高多语言 ASR 在野生环境中的准确性。我们在 FLEURS 数据集上使用 MMS 和 Whisper 模型进行测试,结果显示语言识别准确率分别提高了 8.7% 和 6.1%,相应的词错误率降低了 3.3% 和 2.0%。

关键词

引用

@article{arxiv.2409.18428,
  title  = {Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking},
  author = {Brian Yan and Vineel Pratap and Shinji Watanabe and Michael Auli},
  journal= {arXiv preprint arXiv:2409.18428},
  year   = {2024}
}