中文

DRIP:通过 token 级表示编辑与残差指令融合防御提示注入

密码学与安全 2025-11-19 v2 人工智能

摘要

大型语言模型(LLM)正越来越多地集成到 IT 基础设施中,它们根据预定义的指令处理用户数据。然而,传统的 LLM 仍然容易受到提示注入攻击,即恶意用户将指令性 token 注入数据中以颠覆模型行为。现有的防御措施训练 LLM 在语义上分离数据和指令 token,但仍然难以(1)平衡效用和安全性,以及(2)防止数据中类似指令的语义覆盖预期的指令。我们提出了 DRIP,它(1)精确地从数据部分的 token 中移除指令语义,同时保留其数据语义,并且(2)即使在强大的对抗性内容下也能稳健地保留预期指令的效果。为了“去指令化”数据 token,DRIP 引入了一个数据整理和训练范式,带有一个轻量级的表示编辑模块,该模块编辑数据部分中类似指令的 token 的嵌入,从而在不损害效用的情况下增强安全性。为了确保指令的不可覆盖性,DRIP 添加了一个最小残差模块,该模块降低了对抗性数据覆盖原始指令的能力。我们在 LLaMA 8B 和 Mistral 7B 上,针对三个提示注入基准(SEP、AlpacaFarm 和 InjecAgent),将 DRIP 与 StruQ、SecAlign、ISE 和 PFT 进行了评估。DRIP 将角色分离分数提高了 12-49%,在自适应攻击下将攻击成功率降低了超过 66%,并且与未防御模型的效用相匹配,为提示注入鲁棒性建立了新的最先进水平。

关键词

引用

@article{arxiv.2511.00447,
  title  = {DRIP: Defending Prompt Injection via Token-wise Representation Editing and Residual Instruction Fusion},
  author = {Ruofan Liu and Yun Lin and Zhiyong Huang and Jin Song Dong},
  journal= {arXiv preprint arXiv:2511.00447},
  year   = {2025}
}