零资源多方言阿拉伯语自然语言理解
计算与语言
2022-05-27 v2
摘要
在下游任务上微调预训练语言模型(PLM)需要相当数量的标注数据。然而,为不同语言变体获取标注样本可能代价高昂。本文中,我们考察了仅在现代标准阿拉伯语(MSA)数据上微调 PLM 时其在方言阿拉伯语(DA)上的零样本性能——发现此类模型在 DA 上评估时存在显著的性能下降。为弥补该性能下降,我们提出利用无标注 DA 数据进行自训练,并将其应用于多种 DA 变体上的命名实体识别(NER)、词性(POS)标注与讽刺检测(SRD)。我们的结果展示了无标注 DA 数据自训练的有效性:将零样本 MSA 到 DA 的迁移分别提升多达约 10% F(NER)、2% 准确率(POS 标注)与 4.5% F(SRD)。我们进行了消融实验并表明所观察到的性能提升直接源于用于自训练的无标注 DA 样本。我们的工作为利用相对丰富的标注 MSA 数据集来开发零资源与低资源方言的 DA 模型开辟了机会。我们还报告了全部三项任务上的新最优性能,并为研究社区开源了我们的微调模型。
引用
@article{arxiv.2104.06591,
title = {Zero-Resource Multi-Dialectal Arabic Natural Language Understanding},
author = {Muhammad Khalifa and Hesham Hassan and Aly Fahmy},
journal= {arXiv preprint arXiv:2104.06591},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2101.04758