LocalAlign:通过生成接近目标对抗示例以实现通用提示注入防御
密码学与安全
2026-05-05 v1
摘要
大语言模型正越来越多地嵌入与用户数据、检索的网络内容和外部工具交互的系统中,创造了新的攻击面:提示注入,当恶意命令嵌入不可信数据中时,会覆盖受信任命令并导致意外行为。现有的防御主要依赖于微调模型以保留受信任命令与不可信数据部分之间的显式边界,以便模型学习优先处理受信任字段并忽略数据中的恶意命令。然而,我们注意到尽管这些防御可以阻止因注入命令导致的明显恶意响应,但它们对实际场景的泛化性较差,其中模型对注入命令的响应与正确响应非常接近。这是因为现有方法通常仅针对固定的一组手工制作的攻击目标进行训练,导致围绕正确响应的边界松散,更容易被规避。为此,我们提出了 LocalAlign,一种受对抗训练启发的更通用提示注入防御。LocalAlign 自动且有效地生成对抗示例,其中数据部分嵌入的命令会引起接近正确响应但仍不正确的响应。我们通过提示和单个推理步骤生成此类接近但错误的对抗示例。该设计强制围绕正确响应施加更紧密的鲁棒性边界:即使是来自不可信数据的小响应位移也会被显式惩罚。此外,生成的对抗示例在不同样本间质量差异很大。为此,我们进一步引入了一种margin-aware 对齐算法,用于量化每个样本到正确响应的距离,并为更接近的样本分配更大的训练权重。
引用
@article{arxiv.2605.01462,
title = {LocalAlign: Enabling Generalizable Prompt Injection Defense via Generation of Near-Target Adversarial Examples for Alignment Training},
author = {Yuyang Gong and Zihao Wang and Jiawei Liu and XiaoFeng Wang},
journal= {arXiv preprint arXiv:2605.01462},
year = {2026}
}