面向低资源语言(印尼语、爪哇语、巽他语)多语种ASR的XLS-R深度学习模型
计算与语言
2024-01-17 v1 机器学习
声音
音频与语音处理
摘要
本研究论文聚焦于使用XLS-R 300m模型开发和评估自动语音识别(ASR)技术。研究旨在提升ASR将口语转换为书面文本的性能,特别是针对印尼语、爪哇语和巽他语。论文讨论了测试过程、使用的数据集以及训练和评估ASR系统所采用的方法。结果表明,XLS-R 300m模型取得了有竞争力的词错误率(WER)指标,但在爪哇语和巽他语上性能略有下降。集成5-gram KenLM语言模型显著降低了WER并提高了ASR准确率。该研究通过解决语言多样性问题和提升跨多种语言的性能,为ASR技术的进步做出了贡献。研究结果为优化ASR在不同语言环境下的准确性和适用性提供了见解。
引用
@article{arxiv.2401.06832,
title = {XLS-R Deep Learning Model for Multilingual ASR on Low- Resource Languages: Indonesian, Javanese, and Sundanese},
author = {Panji Arisaputra and Alif Tri Handoyo and Amalia Zahra},
journal= {arXiv preprint arXiv:2401.06832},
year = {2024}
}