防御神经假新闻
计算与语言
2020-12-14 v3 计算机与社会
摘要
自然语言生成的最新进展引发了双重用途担忧。尽管摘要与翻译等应用具有积极意义,其底层技术也可能使对手能够生成神经假新闻:紧密模仿真实新闻风格的定向宣传。现代计算机安全依赖于细致的威胁建模:从对手视角识别潜在威胁与漏洞,并探索针对这些威胁的缓解措施。同样,开发针对神经假新闻的稳健防御,需要我们首先细致调查并刻画这些模型的风险。因此我们提出一种称为Grover的可控文本生成模型。给定诸如“疫苗与自闭症之间存在关联”的标题,Grover可生成文章其余部分;人类认为这些生成内容比人类撰写的虚假信息更可信。针对诸如Grover之类的生成器开发稳健验证技术至关重要。我们发现,在假定可获得中等规模训练数据的情况下,当前最佳判别器能以73%的准确率将神经假新闻与真实人类撰写的新闻分类。反直觉的是,对抗Grover的最佳防御手段竟是Grover自身,其准确率达92%,这证明了公开发布强生成器的重要性。我们进一步探究这些结果,表明暴露偏差——以及缓解其影响的采样策略——均会留下类似判别器可捕捉的痕迹。我们最后讨论了有关该技术的伦理问题,并计划公开发布Grover,助力更好地检测神经假新闻。
引用
@article{arxiv.1905.12616,
title = {Defending Against Neural Fake News},
author = {Rowan Zellers and Ari Holtzman and Hannah Rashkin and Yonatan Bisk and Ali Farhadi and Franziska Roesner and Yejin Choi},
journal= {arXiv preprint arXiv:1905.12616},
year = {2020}
}
备注
NeurIPS 2019 camera ready version. Project page/code/demo at https://rowanzellers.com/grover