中文

PlanGuard: 基于规划一致性验证防御代理人间接注入

密码学与安全 2026-04-14 v1

摘要

大型语言模型(LLM)代理人正日益集成到关键系统中, 利用外部工具与现实世界交互。然而, 这种能力将它们暴露于间接注入(IPI)风险, 攻击者可将恶意指令嵌入检索内容以操控代理人执行未授权或意外的动作。现有防御主要聚焦于预处理阶段, 忽略了对模型实际行为的监控。在本文中, 我们提出了 PlanGuard, 这是一个基于上下文隔离原则的训练免费防御框架。与先前方法不同, PlanGuard 引入了一个孤立的 Planner, 其仅基于用户指令生成一组有效动作作为参考。此外, 我们设计了分层验证机制, 首先强制执行严格的硬性约束以阻止未授权的工具调用, 随后采用意图验证器来验证参数偏差是良性格式变异还是恶意劫持。在 InjecAgent 数据集上进行的实验表明, PlanGuard 能有效中和这些攻击, 将攻击成功率(ASR)从 72.8% 降至 0%, 同时保持可接受的误报率为 1.49%。此外, 本方法具有模型中立性且高度兼容。

关键词

引用

@article{arxiv.2604.10134,
  title  = {PlanGuard: Defending Agents against Indirect Prompt Injection via Planning-based Consistency Verification},
  author = {Guangyu Gong and Zizhuang Deng},
  journal= {arXiv preprint arXiv:2604.10134},
  year   = {2026}
}