面向稠密检索语料库中毒攻击的 HotFlip 复现
信息检索
2025-03-11 v2 计算与语言
摘要
HotFlip 是一种基于梯度的词替换方法,用于攻击语言模型。最近,该方法被进一步应用于攻击检索系统,其方式是生成恶意段落并将其注入语料库中,即语料库中毒。然而,已知 HotFlip 的计算效率低下,大部分时间都花费在对抗性 token 生成阶段为每个查询-段落对累积梯度上,这使得在合理的时间内生成足够数量的对抗性段落成为不可能。此外,该攻击方法本身假设可以访问一组用户查询,这是一个强假设,与现实世界中对抗性攻击通常的执行方式不符。在本文中,我们首先显著提升了 HotFlip 的效率,在相同硬件下,将每个文档的对抗性生成过程从 4 小时缩短至仅 15 分钟。我们进一步贡献了在两个额外任务上的实验与分析:(1) 基于迁移的黑盒攻击,以及 (2) 与查询无关的攻击。只要可能,我们就提供原始方法与改进版本之间的比较。我们的实验表明,HotFlip 能够有效攻击多种稠密检索器,并观察到其攻击性能在面对更先进和近期的方法时呈下降趋势。有趣的是,我们观察到,尽管 HotFlip 在黑盒设置下表现不佳,表明其泛化能力有限,但在与查询无关的场景中,其性能与注入的对抗性段落的数量相关。
引用
@article{arxiv.2501.04802,
title = {Reproducing HotFlip for Corpus Poisoning Attacks in Dense Retrieval},
author = {Yongkang Li and Panagiotis Eustratiadis and Evangelos Kanoulas},
journal= {arXiv preprint arXiv:2501.04802},
year = {2025}
}
备注
This paper has been accepted for oral presentation in the reproducibility track at ECIR 2025