利用影响力标记欺骗检索器:一种高效的黑盒语料库投毒攻击
机器学习
2025-03-28 v1 密码学与安全
摘要
检索增强生成(RAG)系统通过引入外部知识库来增强大型语言模型,解决内部知识陈旧和幻觉等问题。然而,它们依赖外部知识库,使其易受到语料库投毒攻击,攻击者可注入对抗性段落以操纵检索结果。现有制造此类段落的方法,如随机标记替换或训练逆转模型,往往缓慢且计算昂贵,需要访问检索器的梯度或大量计算资源。为此,我们提出Dynamic Importance-Guided Genetic Algorithm(DIGA),一种高效的黑盒方法,利用检索器的两个关键特性:对标记顺序不敏感以及偏向于影响力标记。通过聚焦于这些特征,DIGA动态调整其遗传操作,以显著降低时间和内存使用,生成有效的对抗性段落。我们的实验评估显示,DIGA 在多个数据集上实现了卓越的效率和可扩展性,同时保持了与现有方法相当或更好的攻击成功率。
引用
@article{arxiv.2503.21315,
title = {Tricking Retrievers with Influential Tokens: An Efficient Black-Box Corpus Poisoning Attack},
author = {Cheng Wang and Yiwei Wang and Yujun Cai and Bryan Hooi},
journal= {arXiv preprint arXiv:2503.21315},
year = {2025}
}
备注
Accepted to NAACL 2025 Main Track