中文

AraELECTRA:用于阿拉伯语语言理解的文本判别器预训练

计算与语言 2021-03-09 v2

摘要

英语语言表示的进展通过高效学习准确分类词元替换的编码器(ELECTRA)实现了更具样本效率的预训练任务。该任务不是训练模型恢复被掩码的词元,而是训练一个判别器模型来区分真实输入词元与由生成器网络替换的损坏词元。另一方面,当前的阿拉伯语语言表示方法仅依赖于通过掩码语言建模进行预训练。在本文中,我们开发了一个阿拉伯语语言表示模型,命名为AraELECTRA。我们的模型在大型阿拉伯语文本语料库上使用替换词元检测目标进行预训练。我们在多个阿拉伯语NLP任务上评估我们的模型,包括阅读理解、情感分析和命名实体识别,并且我们表明,在相同的预训练数据甚至更小的模型规模下,AraELECTRA优于当前最先进的阿拉伯语语言表示模型。

关键词

引用

@article{arxiv.2012.15516,
  title  = {AraELECTRA: Pre-Training Text Discriminators for Arabic Language Understanding},
  author = {Wissam Antoun and Fady Baly and Hazem Hajj},
  journal= {arXiv preprint arXiv:2012.15516},
  year   = {2021}
}