MiLMo:少数民族多语言预训练语言模型
计算与语言
2023-04-11 v2
摘要
预训练语言模型在大规模无监督数据上训练,仅能在小规模标注数据集上微调模型并取得良好结果。多语言预训练语言模型可在多种语言上训练,使模型同时理解多种语言。目前对预训练模型的研究主要集中于资源丰富的语言,而对少数民族语言等低资源语言的研究相对较少,且公开的多语言预训练语言模型在少数民族语言上表现不佳。因此,本文构建了在少数民族语言任务上表现更优的多语言预训练模型 MiLMo,涵盖蒙古语、藏语、维吾尔语、哈萨克语和朝鲜语。为解决少数民族语言数据集稀缺问题并验证 MiLMo 模型有效性,本文构建了少数民族多语言文本分类数据集 MiTC,并为每种语言训练了 word2vec 模型。通过在文本分类任务中对比 word2vec 模型与预训练模型,本文为少数民族语言的下游任务研究提供了最优方案。最终实验结果表明,预训练模型性能优于 word2vec 模型,并在少数民族多语言文本分类中取得最佳结果。多语言预训练模型 MiLMo、多语言 word2vec 模型及多语言文本分类数据集 MiTC 发布于 http://milmo.cmli-nlp.com/。
引用
@article{arxiv.2212.01779,
title = {MiLMo:Minority Multilingual Pre-trained Language Model},
author = {Junjie Deng and Hanru Shi and Xinhe Yu and Wugedele Bao and Yuan Sun and Xiaobing Zhao},
journal= {arXiv preprint arXiv:2212.01779},
year = {2023}
}