通过近似贪婪梯度下降进行语料库投毒
信息检索
2024-10-28 v2
摘要
密集检索器广泛用于信息检索,并已成功扩展到其他知识密集型领域,如语言模型,例如检索增强生成(RAG)系统。不幸的是,最近研究表明它们容易受到语料库投毒攻击,其中恶意用户将少量对抗性段落注入检索语料库,以诱使系统针对广泛的用户查询将这些段落返回为排名靠前的结果。需要进一步研究以了解这些攻击在多大程度上可能限制密集检索器在实际应用中的部署。在这项工作中,我们提出了近似贪婪梯度下降(AGGD),这是一种基于广泛使用的HotFlip方法高效生成对抗性段落的密集检索系统新攻击。我们证明,AGGD可以通过用更结构化的搜索替换其随机令牌采样,选择比HotFlip更高质量的令牌级扰动集。实验表明,我们的方法在多个数据集和多个检索器上实现了高攻击成功率,并且可以泛化到未见过的查询和新领域。值得注意的是,我们的方法在攻击ANCE检索模型方面非常有效,在NQ和MS MARCO数据集上分别比HotFlip高出15.24%和17.44%的攻击成功率。此外,我们展示了AGGD在替代HotFlip进行其他对抗性攻击(如RAG系统的知识投毒)方面的潜力。
引用
@article{arxiv.2406.05087,
title = {Corpus Poisoning via Approximate Greedy Gradient Descent},
author = {Jinyan Su and Preslav Nakov and Claire Cardie},
journal= {arXiv preprint arXiv:2406.05087},
year = {2024}
}