事实破坏者:面向事实核查系统的证据操纵攻击分类法
密码学与安全
2023-06-19 v4 计算与语言
计算机与社会
机器学习
摘要
虚假与误导信息对我们的安全构成重大全球威胁。为应对在线误导信息的规模,研究者致力于通过检索相关证据并验证来实现事实核查自动化。然而,尽管进展众多,对此类系统可能攻击向量的全面评估仍显不足。特别是,自动化事实核查过程可能正受其试图对抗的误导信息活动的攻击。本工作中,我们假设一个通过对在线证据自动篡改以破坏事实核查模型的对手,手段为伪装相关证据或植入误导性证据。我们首先提出一个探索性分类法,涵盖这两类目标及不同威胁模型维度。据此,我们设计并提出若干潜在攻击方法。我们表明,可微妙修改证据中声明关键片段并生成多样且与声明对齐的证据,从而在分类法各维度的多种组合下严重降低事实核查性能。这些攻击对声明的事后修改亦具鲁棒性。我们的分析进一步暗示模型在面对矛盾证据时推理的潜在局限。我们强调此类攻击可对模型的可检视及人在回路使用场景产生有害影响,并最后讨论未来防御的挑战与方向。
引用
@article{arxiv.2209.03755,
title = {Fact-Saboteurs: A Taxonomy of Evidence Manipulation Attacks against Fact-Verification Systems},
author = {Sahar Abdelnabi and Mario Fritz},
journal= {arXiv preprint arXiv:2209.03755},
year = {2023}
}