通过规避性注入绕过提示注入检测器
密码学与安全
2026-04-02 v2 人工智能
摘要
大型语言模型(LLM)在交互式和检索增强系统中日益广泛应用,但仍 vulnerable to 提示注入攻击——注入的次要提示会迫使模型偏离用户指令,执行由对手定义的潜在恶意任务。最近的研究表明,基于LLM隐藏层激活偏移的机器学习模型可检测此类偏移。本文演示这些检测器对自适应对手而言并不稳健。我们提出一种多探针规避攻击,将 adversarially optimised后缀附加到受污染输入上,联合优化一个通用后缀,以同时蒙蔽所有图层级检测器,同时保持底层注入的有效性。采用修改的Greedy Coordinate Gradient(GCG)方法,我们生成通用后缀,使提示注入在多个探针上均能持续规避。对于Phi-3 3.8B和Llama-3 8B模型,单个后缀即可实现93.91%和99.63%的攻击成功率,成功规避所有检测器。这些结果表明,基于激活的任务漂移检测器对自适应提示注入攻击极其脆弱,亟需更强的防御措施。我们还提出一种基于对抗后缀增强的防御方法:生成多个后缀,在前向传播期间随机添加一个,并在所得激活上训练检测器。该方法被证明对规避性攻击有效。
引用
@article{arxiv.2602.00750,
title = {Bypassing Prompt Injection Detectors through Evasive Injections},
author = {Md Jahedur Rahman and Ihsen Alouani},
journal= {arXiv preprint arXiv:2602.00750},
year = {2026}
}
备注
This paper is to appear at ICNNN 2026