中文

通过少量 DefensiveTokens 对抗 Prompt Injection

密码学与安全 2025-08-26 v2

摘要

当大型语言模型 (LLM) 系统与外部数据交互以执行复杂任务时,一种新型攻击——提示注入 (prompt injection)——成为重要威胁。通过注入系统访问的数据中的指令,攻击者能够覆盖初始用户任务,执行由攻击者导向的任意任务。为保护系统,测试时防御措施(如防御性提示)已被提出,以便系统开发人员在需要时以灵活方式实现安全。然而,这些措施比改变模型参数的训练时防御措施效果较差。为此,我们提出了 DefensiveToken,即一种具备提示注入鲁棒性的测试时防御方法。DefensiveToken 通过插入新型特殊 token 实现,其嵌入向量经过优化以提升安全性。在安全性敏感的场景中,系统开发人员可在 LLM 输入前追加少量 DefensiveToken,以实现安全,同时最小化实用性损失。在安全性不那么重要的场景中,开发人员可直接跳过 DefensiveToken;LLM 系统保持原样(无防御),生成高质量响应。因此,若 DefensiveToken 随模型发布,便可在测试时在最先进 (SOTA) 实用性与接近 SOTA 安全性之间灵活切换。代码已公开于 https://github.com/Sizhe-Chen/DefensiveToken。

关键词

引用

@article{arxiv.2507.07974,
  title  = {Defending Against Prompt Injection With a Few DefensiveTokens},
  author = {Sizhe Chen and Yizhu Wang and Nicholas Carlini and Chawin Sitawarin and David Wagner},
  journal= {arXiv preprint arXiv:2507.07974},
  year   = {2025}
}