防御三难:为何提示注入防御包装器会失败?
密码学与安全
2026-04-14 v3 人工智能
摘要
我们证明了对于具有连通提示空间的语言模型,任何连续且保持效用的包装防御——即在模型看到输入前对其进行预处理的函数 ——无法使所有输出严格安全,并准确刻画了每种此类防御必须失败的确切位置。在 successively更强的假设下,我们建立了三个结果:边界固定—防御必须保持某些阈值级输入不变;-鲁棒约束—在 Lipschitz 正则性下,固定边界点周围的一正测度带区域保持接近阈值;以及在 transversality 条件下持久的不安全区域—输入的一个正测度子集保持严格不安全。这些构成了防御三难:连续性、效用保持和完整性不能共存。我们证明了无需拓扑学的平行离散结果,并扩展到多轮交互、随机防御和容量平等设置。结果不排除训练时对齐、架构更改或牺牲效用的防御。完整理论在 Lean 4 中被机械验证,并在三个大语言模型上经验验证。
关键词
引用
@article{arxiv.2604.06436,
title = {The Defense Trilemma: Why Prompt Injection Defense Wrappers Fail?},
author = {Manish Bhatt and Sarthak Munshi and Vineeth Sai Narajala and Idan Habler and Ammar Al-Kahfah and Ken Huang and Joel Webb and Blake Gatto and Md Tamjidul Hoque},
journal= {arXiv preprint arXiv:2604.06436},
year = {2026}
}