调查文本生成中对阴谋论的记忆现象
计算与语言
2021-06-10 v3 计算机与社会
摘要
采用自然语言生成(NLG)模型可能使个人易受模型所记忆的有害信息(如阴谋论)生成的影响。尽管先前研究在社交媒体背景下考察了阴谋论,但尚未评估其在生成式语言模型这一新空间中的存在。本工作中,我们研究语言模型生成阴谋论文本的能力。具体而言,我们旨在回答:能否在无模型训练数据访问权限的情况下,测试预训练生成式语言模型对阴谋论记忆与诱发的能力?我们强调了该任务的困难性,并在记忆、泛化与幻觉的语境中加以讨论。利用一个由阴谋论主题与机器生成的阴谋论组成的新数据集,我们发现许多阴谋论深深根植于预训练语言模型中。我们的实验展示了模型参数(如规模与温度)与其生成阴谋论文本倾向之间的关系。这些结果表明,在发布前需对 NLG 应用进行更彻底的审查,并深入讨论生成式语言模型中记忆现象的缺陷。
引用
@article{arxiv.2101.00379,
title = {Investigating Memorization of Conspiracy Theories in Text Generation},
author = {Sharon Levy and Michael Saxon and William Yang Wang},
journal= {arXiv preprint arXiv:2101.00379},
year = {2021}
}
备注
ACL 2021 Findings