AraGPT2:用于阿拉伯语语言生成的预训练 Transformer
计算与语言
2021-03-09 v2
摘要
近来,基于预训练 Transformer 的架构已被证明在语言建模与理解上非常高效,前提是其在足够大的语料上训练。阿拉伯语的语言生成应用相较于其他 NLP 进展仍然滞后,主要由于缺乏先进的阿拉伯语语言生成模型。本文中,我们开发了首个先进的阿拉伯语语言生成模型 AraGPT2,该模型从零开始在大型阿拉伯语互联网文本与新闻文章语料上训练。我们最大的模型 AraGPT2-mega 具有 14.6 亿参数,这使其成为现有最大的阿拉伯语语言模型。该 mega 模型经评估,在包括合成新闻生成与零样本问答在内的不同任务上表现出成功。在文本生成方面,我们的最佳模型在留出 Wikipedia 文章上取得了 29.8 的困惑度。一项由人类评估者进行的研究显示了 AraGPT2-mega 在生成难以与人类撰写文章区分的新闻文章上的显著成功。因此我们开发并发布了一个以 98% 准确率检测模型生成文本的自动判别器模型。这些模型亦公开可用,希望借此鼓励阿拉伯语 NLP 的新研究方向与应用。
引用
@article{arxiv.2012.15520,
title = {AraGPT2: Pre-Trained Transformer for Arabic Language Generation},
author = {Wissam Antoun and Fady Baly and Hazem Hajj},
journal= {arXiv preprint arXiv:2012.15520},
year = {2021}
}