中文

用于检测阿拉伯语GPT2自动生成推文的BERT Transformer模型

计算与语言 2021-01-26 v1

摘要

在过去的二十年中,我们逐渐转向互联网和社交媒体以获取新闻、进行娱乐对话和分享观点。最近,OpenAI开发了一种称为GPT-2(Generative Pre-trained Transformer-2,生成式预训练Transformer-2)的机器学习系统,其可生成深度伪造文本。它能够基于简短的写作提示生成看起来像人类所写的文本块,助长虚假或自动生成文本的传播。顺应这一进展,并为应对潜在危险,已有若干方法被提出用于检测这些语言模型所写的文本。在本文中,我们提出了一种基于迁移学习的模型,能够检测阿拉伯语句子是由人类书写还是由机器人自动生成。我们的数据集基于先前工作的推文,我们通过Twitter API对其进行了爬取和扩展。我们使用GPT2-Small-Arabic生成伪造的阿拉伯语句子。为进行评估,我们将不同的基于循环神经网络(RNN)词嵌入的基线模型(即LSTM、BI-LSTM、GRU和BI-GRU)与基于Transformer的模型进行了比较。我们的新迁移学习模型准确率高达98%。据我们所知,这项工作是首个将ARABERT与GPT2结合以检测和分类阿拉伯语自动生成文本的研究。

关键词

引用

@article{arxiv.2101.09345,
  title  = {BERT Transformer model for Detecting Arabic GPT2 Auto-Generated Tweets},
  author = {Fouzi Harrag and Maria Debbah and Kareem Darwish and Ahmed Abdelali},
  journal= {arXiv preprint arXiv:2101.09345},
  year   = {2021}
}