通过多语言微调与持续预训练将多语言语音表征模型适配于一种新的低资源语言
计算与语言
2023-01-19 v1 机器学习
音频与语音处理
摘要
近年来,通过在大规模多语言文本或语音数据上进行自监督预训练得到的神经模型,在低资源语言上展现出了有前景的结果,尤其是在有相对大量的相关语言数据可用时。尽管该技术在促进语言记录项目中的任务(如语音转写)方面具有潜力,但为每一种新语言从头预训练一个多语言模型是极不现实的。我们研究了将现有的多语言 wav2vec 2.0 模型适配于一种新语言的可能性,重点关注来自一种极度濒危语言——阿伊努语——的实际田野调查数据。具体而言,我们(i)考察了在微调中利用相似语言数据的可行性;(ii)验证了通过在目标语言数据上进一步预训练能否提升模型性能。我们的结果表明,持续预训练是将 wav2vec 2.0 模型适配于新语言最有效的方法,并带来了错误率的显著降低。此外,我们发现,如果有一个在相关语音变体或具有相似音系特征的不相关语言上预训练的模型可用,当目标语言中仅有极少量标注数据时,使用该语言的额外数据进行多语言微调会对语音识别性能产生积极影响。
引用
@article{arxiv.2301.07295,
title = {Adapting Multilingual Speech Representation Model for a New, Underresourced Language through Multilingual Fine-tuning and Continued Pretraining},
author = {Karol Nowakowski and Michal Ptaszynski and Kyoko Murasaki and Jagna Nieuważny},
journal= {arXiv preprint arXiv:2301.07295},
year = {2023}
}
备注
14 pages