基于公开与无意触发器的密集检索后门攻击
计算与语言
2025-08-26 v3
摘要
密集检索系统已广泛应用于各种 NLP 应用中。然而,其对潜在攻击的脆弱性尚未得到充分研究。本文研究了一种新型攻击场景,攻击者旨在误导检索系统检索攻击者指定的内容。这些由攻击者注入检索语料库的内容,可能包含仇恨言论或垃圾信息等有害文本。以往的方法依赖于模型权重并生成引人注目的、不自然的输出,与此不同,我们提出了一种由语法错误触发的隐蔽后门攻击。我们的方法确保受攻击模型在处理标准查询时能正常运作,同时在出现轻微语言错误时隐蔽地触发对攻击者内容的检索。具体而言,密集检索器使用对比损失和困难负采样进行训练。令人惊讶的是,我们的研究结果表明,对比损失对语法错误非常敏感,而困难负采样会加剧对后门攻击的易感性。我们提出的方法实现了高攻击成功率,且最小语料库中毒率仅为 0.048%,同时保持了正常的检索性能。这表明该方法对无错误查询的用户体验影响微乎其微。此外,跨三种现实世界防御策略的评估表明,嵌入语料库中的恶意段落仍然高度抵抗检测和过滤,突显了所提出攻击的鲁棒性和隐蔽性\footnote{本工作代码可在 https://github.com/ruyue0001/Backdoor_DPR 获取}。
引用
@article{arxiv.2402.13532,
title = {Backdoor Attacks on Dense Retrieval via Public and Unintentional Triggers},
author = {Quanyu Long and Yue Deng and LeiLei Gan and Wenya Wang and Sinno Jialin Pan},
journal= {arXiv preprint arXiv:2402.13532},
year = {2025}
}
备注
Accepted by COLM 2025