IPIGuard:基于工具依赖图的间接提示注入 LLM 代理防御新方案
密码学与安全
2025-08-22 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)代理广泛部署于实际应用中,通过调用工具获取和操作外部数据以完成复杂任务。然而,在与不可信数据源(如从公共网站获取信息)交互时,工具响应可能包含被注入的指令,从而隐式影响代理行为并导致恶意结果,这种威胁称为间接提示注入(Indirect Prompt Injection, IPI)。现有防御方法通常依赖先进的提示策略或辅助检测模型。虽然这些方法展现出一定效果,但本质上依赖于模型固有的安全假设,缺乏对代理行为结构约束,导致代理仍可获得对工具调用的完全控制权,易受能规避模型安全警戒的更强攻击向量。为防止恶意工具调用,我们提出一种新型任务执行范式——IPIGuard,将代理的任务执行过程建模为对计划工具依赖图(Tool Dependency Graph, TDG)的遍历。通过显式解耦行动规划与外部数据交互,IPIGuard显著减少了由注入指令触发的意外工具调用,从而增强了对 IPI 攻击的鲁棒性。在 AgentDojo 数据集上的实验表明,IPIGuard 在有效性与鲁棒性之间实现了优异的平衡,为开发动态环境中的更安全代理系统铺平了道路。
引用
@article{arxiv.2508.15310,
title = {IPIGuard: A Novel Tool Dependency Graph-Based Defense Against Indirect Prompt Injection in LLM Agents},
author = {Hengyu An and Jinghuai Zhang and Tianyu Du and Chunyi Zhou and Qingming Li and Tao Lin and Shouling Ji},
journal= {arXiv preprint arXiv:2508.15310},
year = {2025}
}
备注
EMNLP 2025