中文

重新审视预训练语言模型及其在阿拉伯语自然语言理解中的评估

计算与语言 2022-05-24 v1

摘要

近年来,为阿拉伯语开发预训练语言模型(PLMs)的工作日益增长。本工作致力于解决现有阿拉伯语PLMs中制约阿拉伯语NLU与NLG领域进展的两个主要问题。第一,现有阿拉伯语PLMs未被充分探索,且其预训练可通过更系统的方法显著改进。第二,文献中缺乏对这些模型的系统且可复现的评估。本工作中,我们重新审视阿拉伯语PLMs的预训练与评估。在预训练方面,我们从三个角度探索改进阿拉伯语LMs:预训练数据质量、模型规模,以及融入字符级信息。据此,我们发布了三个新的阿拉伯语BERT风格模型(JABER、Char-JABER和SABER),以及两个T5风格模型(AT5S和AT5B)。在评估方面,我们开展全面实证研究,系统评估现有最先进模型在ALUE(一个由排行榜驱动的阿拉伯语NLU任务基准)及ARGEN基准中阿拉伯语NLG任务子集上的性能。我们表明,我们的模型显著优于现有阿拉伯语PLMs,并在判别与生成式阿拉伯语NLU和NLG任务上达到新的最先进性能。我们的模型与复现结果的源代码将很快公开。

关键词

引用

@article{arxiv.2205.10687,
  title  = {Revisiting Pre-trained Language Models and their Evaluation for Arabic Natural Language Understanding},
  author = {Abbas Ghaddar and Yimeng Wu and Sunyam Bagga and Ahmad Rashid and Khalil Bibi and Mehdi Rezagholizadeh and Chao Xing and Yasheng Wang and Duan Xinyu and Zhefeng Wang and Baoxing Huai and Xin Jiang and Qun Liu and Philippe Langlais},
  journal= {arXiv preprint arXiv:2205.10687},
  year   = {2022}
}