中文

针对自动化事实核查系统的合成虚假信息攻击

计算与语言 2022-02-22 v1

摘要

自动化事实核查是一项遏制在线错误信息传播所需的技术。此类解决方案的一个当前框架提议通过从相关文本源检索支持或反驳证据来核查声明。然而,事实核查者的实际用例将要求针对可能受同一错误信息影响的证据源核查声明。此外,能够生成连贯伪造内容的现代 NLP 工具的发展,将使恶意行为者能够系统性地为事实核查者生成对抗性虚假信息。本工作中,我们在两种模拟设定下探究自动化事实核查者对合成对抗性证据的敏感性:AdversarialAddition,即我们伪造文档并将其加入事实核查系统可用的证据库;以及 AdversarialModification,即库中的现有证据源文档被自动篡改。我们在三个基准上跨多个模型的研究表明,这些系统在面对此类攻击时性能显著下降。最后,我们讨论了现代 NLG 系统作为虚假信息生成者,对自动化事实核查者所带来挑战日益增长的威胁。

关键词

引用

@article{arxiv.2202.09381,
  title  = {Synthetic Disinformation Attacks on Automated Fact Verification Systems},
  author = {Yibing Du and Antoine Bosselut and Christopher D. Manning},
  journal= {arXiv preprint arXiv:2202.09381},
  year   = {2022}
}

备注

AAAI 2022