你是Robert还是RoBERTa?利用神经文本生成器欺骗在线作者身份归属模型
计算与语言
2022-03-21 v1 人工智能
机器学习
摘要
近来,强大的预训练自然语言模型(包括GPT-2、Grover和XLM)不断发展。这些模型在多种NLP任务上展现出SOTA能力,包括问答、内容摘要与文本生成。与此同时,许多研究聚焦于在线作者身份归属(AA),即利用模型识别在线文本作者。鉴于自然语言模型生成令人信服文本的能力,本文考察这些语言模型生成能够欺骗在线AA模型的文本的程度。我们利用博客与Twitter数据实验,使用GPT-2语言模型基于在线用户已有帖子生成文本。随后我们检验这类基于AI的文本生成器是否能模仿作者风格至足以欺骗典型AA模型的程度。由此我们发现,当前基于AI的文本生成器能成功模仿作者身份,在两个数据集上均展现此能力。我们的发现进而凸显了强大自然语言模型生成可模仿作者风格以充分欺骗主流AA方法的原创在线帖子的当前能力;鉴于AA在垃圾检测与法医调查等现实应用中的拟议角色,这是一项关键发现。
引用
@article{arxiv.2203.09813,
title = {Are You Robert or RoBERTa? Deceiving Online Authorship Attribution Models Using Neural Text Generators},
author = {Keenan Jones and Jason R. C. Nurse and Shujun Li},
journal= {arXiv preprint arXiv:2203.09813},
year = {2022}
}
备注
13 pages, 6 figures, 4 tables, Accepted for publication in the proceedings of the sixteenth International AAAI Conference on Web and Social Media (ICWSM-22)