面向阿拉伯语方言方差鲁棒性的参数与数据高效持续预训练
计算与语言
2022-11-09 v1 机器学习
摘要
使用多语言语言模型处理低资源与高资源语言任务已成为深度学习中的成功范例。近来,阿拉伯语因其方言方差而受到广泛关注。尽管先前的研究试图使这些多语言模型适应阿拉伯语的方言变体,但由于缺乏足够的单语方言数据及此类方言变体的平行翻译数据,这仍是一个具有挑战性的问题。有限方言数据能否用于改进在阿拉伯语方言变体上训练的模型,仍是一个开放问题。首先,我们表明,在多语 Arabic 单语数据上增量预训练的多语言-BERT(mBERT)相比我们定制的单语阿拉伯语模型训练时间更短且精度相当,并超越现有模型(平均指标 +)。我们随后探索了两种持续预训练方法——(1)使用少量方言数据进行持续微调,以及(2)平行阿拉伯语到英语数据及翻译语言建模损失函数。我们表明,这两种方法在用于单语模型时均有助于提升方言分类任务上的性能(平均增益 )。
引用
@article{arxiv.2211.03966,
title = {Parameter and Data Efficient Continual Pre-training for Robustness to Dialectal Variance in Arabic},
author = {Soumajyoti Sarkar and Kaixiang Lin and Sailik Sengupta and Leonard Lausen and Sheng Zha and Saab Mansour},
journal= {arXiv preprint arXiv:2211.03966},
year = {2022}
}