中文

面向低资源语言(印尼语、爪哇语、巽他语)多语种ASR的XLS-R深度学习模型

计算与语言 2024-01-17 v1 机器学习 声音 音频与语音处理

摘要

本研究论文聚焦于使用XLS-R 300m模型开发和评估自动语音识别(ASR)技术。研究旨在提升ASR将口语转换为书面文本的性能,特别是针对印尼语、爪哇语和巽他语。论文讨论了测试过程、使用的数据集以及训练和评估ASR系统所采用的方法。结果表明,XLS-R 300m模型取得了有竞争力的词错误率(WER)指标,但在爪哇语和巽他语上性能略有下降。集成5-gram KenLM语言模型显著降低了WER并提高了ASR准确率。该研究通过解决语言多样性问题和提升跨多种语言的性能,为ASR技术的进步做出了贡献。研究结果为优化ASR在不同语言环境下的准确性和适用性提供了见解。

关键词

引用

@article{arxiv.2401.06832,
  title  = {XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese},
  author = {Panji Arisaputra and Alif Tri Handoyo and Amalia Zahra},
  journal= {arXiv preprint arXiv:2401.06832},
  year   = {2024}
}