PISanitizer: 通过 Prompt 净化防止长上下文 LLM 受到指令注入攻击
密码学与安全
2025-11-17 v1 人工智能
计算与语言
机器学习
摘要
长上下文大语言模型(LLM)易受到指令注入攻击,即攻击者可在长上下文中注入指令,诱导 LLM 生成攻击者期望的输出。现有指令注入防御方法针对短上下文设计,扩展到长上下文场景后有效性受限。其原因在于,注入指令在长上下文中仅占极小比例,防御难度大。本文提出 PISanitizer,通过在后端 LLM 生成响应前先定位并净化上下文中可能的注入标记,从而消除注入指令的影响。为实现净化,PISanitizer 基于两个观察:(1) 指令注入本质上是 crafting 诱导 LLM 遵循该指令的指令;(2) LLM 本质上利用注意力机制聚焦于输出生成中关键输入标记。基于此,我们首先有意让 LLM 遵循上下文中的任意指令,然后净化接收高注意力且驱动指令遵循行为的标记。设计上,PISanitizer 为攻击者造成困境:注入指令越有效地诱导 LLM 遵循,越容易被 PISanitizer 净化。我们的广泛评估表明,PISanitizer 能成功防止指令注入,保持实用性,超越现有防御,高效且对优化型和强适应攻击鲁健。代码已公开于 https://github.com/sleeepeer/PISanitizer。
引用
@article{arxiv.2511.10720,
title = {PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization},
author = {Runpeng Geng and Yanting Wang and Chenlong Yin and Minhao Cheng and Ying Chen and Jinyuan Jia},
journal= {arXiv preprint arXiv:2511.10720},
year = {2025}
}
备注
The code is available at https://github.com/sleeepeer/PISanitizer