相关性幻觉:任意内容注入攻击欺骗检索器、重排序器与 LLM 判官
信息检索
2026-01-01 v2
摘要
本工作考虑一种黑盒威胁模型,其中对手试图在搜索中传播任意非相关内容。我们展示了检索器、重排序器和 LLM 相关性判官都高度脆弱,攻击者可实现任意内容被提升至搜索结果顶部,并获得完美的相关性评分。我们研究了攻击者如何通过内容注入来实现这一目标,即将任意句子注入到相关段落中,或将查询术语注入到任意段落中。我们的研究分析了诸多因素——包括模型类别与规模、相关与非相关内容的比例、注入位置、注入内容的毒性与严重程度,以及 LLM 生成内容的作用——对攻击成功率的影响,揭示了若干新颖、令人担忧且常常反直觉的结果。我们的结果揭示了嵌入模型、基于 LLM 的评分模型以及生成式 LLM 的弱点,凸显了无论模型类型或其在其中所扮演角色,语言模型的整体鲁健性、安全性和可信度都面临关切。我们也强调了对抗这些攻击的稳健防御的挑战。分类器和更谨慎的 LLM 判官往往无法识别包含内容注入的段落,尤其是在考虑多样化文本主题和风格时。我们的发现凸显了进一步研究任意内容注入攻击的必要性。我们发布了代码以便进一步研究。
引用
@article{arxiv.2501.18536,
title = {Illusions of Relevance: Arbitrary Content Injection Attacks Deceive Retrievers, Rerankers, and LLM Judges},
author = {Manveer Singh Tamber and Jimmy Lin},
journal= {arXiv preprint arXiv:2501.18536},
year = {2026}
}
备注
AACL Findings 2025