评估标准弗里斯兰语与方言弗里斯兰语自动语音识别:多语言微调与语言识别以提升低资源性能
计算与语言
2025-02-10 v1 机器学习
声音
音频与语音处理
摘要
由于缺乏足够的标注数据,低资源语言的自动语音识别(ASR)性能仍远落后于英语等高资源语言。最先进的方法采用自监督迁移学习,即使用少量目标低资源语言的标注数据对在大规模数据上预训练的模型进行微调。在本文中,我们提出并研究了一种微调基于自监督学习模型的方法,以提升对弗里斯兰语及其地区方言(克莱弗里斯兰语、伍德弗里斯兰语和南弗里斯兰语)的识别性能。我们表明,通过使用多语言(弗里斯兰语、荷兰语、英语和德语)微调数据以及一个辅助的语言识别任务,可以提升弗里斯兰语自动语音识别的性能。此外,我们的研究结果表明,方言语音的性能显著下降,并且重要的是,这种影响受到用于收集方言数据的诱导方法的调节。我们的发现还特别表明,仅依赖标准语言数据进行自动语音识别评估可能会低估真实世界的性能,尤其是在存在大量方言变异的语言中。
引用
@article{arxiv.2502.04883,
title = {Evaluating Standard and Dialectal Frisian ASR: Multilingual Fine-tuning and Language Identification for Improved Low-resource Performance},
author = {Reihaneh Amooie and Wietse de Vries and Yun Hao and Jelske Dijkstra and Matt Coler and Martijn Wieling},
journal= {arXiv preprint arXiv:2502.04883},
year = {2025}
}