提升挪威语自动语音识别性能
计算与语言
2023-07-06 v1
摘要
本文针对挪威两种官方书面语言——Bokm{\aa}l和Nynorsk,给出了若干自动语音识别(ASR)模型基线。我们在多个挪威语音数据集上比较了不同规模和预训练方法的模型性能。此外,我们将这些模型与先前最先进的ASR模型以及在域外数据集上的表现进行了对比。我们将挪威议会语音语料库(NPSC)上的最先进水平从词错误率(WER)17.10\%提升至7.60\%,其中Bokm{\aa}l模型达5.81\%,Nynorsk达11.54\%。我们还讨论了进一步提升挪威语ASR模型面临的挑战与潜在解决方案。
引用
@article{arxiv.2307.01672,
title = {Boosting Norwegian Automatic Speech Recognition},
author = {Javier de la Rosa and Rolv-Arild Braaten and Per Egil Kummervold and Freddy Wetjen and Svein Arne Brygfjeld},
journal= {arXiv preprint arXiv:2307.01672},
year = {2023}
}
备注
10 pages, 10 figures. Published as Proceedings NoDaLiDa 2023, pages 555--564