使用简单 N-best 重排序提升野生环境中的多语言语音识别
计算与语言
2024-09-30 v1 声音
音频与语音处理
摘要
多语言语音识别(ASR)模型通常在已知语音言语语言的语境中进行评估,但实际情况下这种情况往往不成立。自动语音语言识别(SLID)模型并非完美,误分类会对最终 ASR 准确率产生显著影响。本文提出一种简单且有效的 N-best 重排序方法,通过利用语言模型和基于文本的语言识别模型等外部特征,提高多语言 ASR 在野生环境中的准确性。我们在 FLEURS 数据集上使用 MMS 和 Whisper 模型进行测试,结果显示语言识别准确率分别提高了 8.7% 和 6.1%,相应的词错误率降低了 3.3% 和 2.0%。
关键词
引用
@article{arxiv.2409.18428,
title = {Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking},
author = {Brian Yan and Vineel Pratap and Shinji Watanabe and Michael Auli},
journal= {arXiv preprint arXiv:2409.18428},
year = {2024}
}