LLM排序器易受提示注入攻击
密码学与安全
2026-02-20 v1
摘要
大型语言模型(LLM)已成为强大的重排序器。最近的研究表明,嵌入候选文档中的简单提示注入(即越狱提示攻击)可显著改变LLM的排序决策。虽然这构成了对LLM排序管道的严重安全风险,但这种脆弱性在不同LLM家族、架构和设置下是否持续存在却鲜有探讨。本文我们进行了对LLM重排序器进行全面经验研究,聚焦于两项互补任务:(1)偏好脆弱性评估,通过攻击成功率(ASR)衡量内在易受性;(2)排序脆弱性评估,量化对排序质量(nDCG@10)的运营影响。我们系统性地检验三种常见的排序范式(两两排序、列表排序、集合排序)下的两种注入变体:决策目标劫持和决策准则劫持。除复现先前发现外,我们还扩展了分析范围,涵盖脆弱性在模型家族间的扩展、位置敏感性、主干架构以及跨域鲁棒性。我们的结果刻画了这些脆弱性的边界条件,揭示了关键见解,例如编码器-解码器架构对越狱攻击具有强大的内在韧性。我们公开代码和额外实验结果于https://github.com/ielab/LLM-Ranker-Attack。
引用
@article{arxiv.2602.16752,
title = {The Vulnerability of LLM Rankers to Prompt Injection Attacks},
author = {Yu Yin and Shuai Wang and Bevan Koopman and Guido Zuccon},
journal= {arXiv preprint arXiv:2602.16752},
year = {2026}
}
备注
18 pages, 7 figures