阿拉伯语预训练语言模型中变体、规模与任务类型的交互作用
计算与语言
2021-09-07 v2
摘要
本文探讨了阿拉伯语预训练语言模型中语言变体、数据规模与微调任务类型的影响。为此,我们针对阿拉伯语的三种变体——现代标准阿拉伯语(MSA)、方言阿拉伯语和古典阿拉伯语——构建了三个预训练语言模型,此外还构建了第四个在三者混合语料上预训练的模型。我们还通过构建在缩减版 MSA 变体语料上预训练的附加模型,考察了预训练数据规模的重要性。我们将不同模型相互比较,并与八个公开可用模型在涵盖 12 个数据集的五个 NLP 任务上微调以进行对比。结果表明,预训练数据与微调数据的变体接近度比预训练数据规模更为重要。我们利用这一洞见为所研究任务定义了优化的系统选择模型。
引用
@article{arxiv.2103.06678,
title = {The Interplay of Variant, Size, and Task Type in Arabic Pre-trained Language Models},
author = {Go Inoue and Bashar Alhafni and Nurpeiis Baimukan and Houda Bouamor and Nizar Habash},
journal= {arXiv preprint arXiv:2103.06678},
year = {2021}
}
备注
Accepted to WANLP 2021