中文

基于 XLSR-53 的印尼语自动语音识别

计算与语言 2023-08-23 v1 声音 音频与语音处理

摘要

本研究聚焦于使用 XLSR-53 预训练模型开发印尼语自动语音识别(ASR),XLSR 代表跨语言语音表示(cross-lingual speech representations)。使用此 XLSR-53 预训练模型旨在显著减少非英语语言达到具有竞争力的词错误率(WER)所需的训练数据量。本研究使用的数据总量为 24 小时 18 分 1 秒:(1)TITML-IDN 14 小时 31 分;(2)Magic Data 3 小时 33 分;(3)Common Voice 6 小时 14 分 1 秒。在 WER 为 20% 的情况下,本研究构建的模型在使用 Common Voice 数据集划分测试集时可与同类模型竞争。使用语言模型可将 WER 降低约 8%,使 WER 从 20% 降至 12%。因此,本研究的结果成功完善了先前的研究,以更少的数据量为构建更好的印尼语 ASR 作出了贡献。

关键词

引用

@article{arxiv.2308.11589,
  title  = {Indonesian Automatic Speech Recognition with XLSR-53},
  author = {Panji Arisaputra and Amalia Zahra},
  journal= {arXiv preprint arXiv:2308.11589},
  year   = {2023}
}