通过工具结果解析防御间接提示注入
人工智能
2026-01-09 v1 计算与语言
密码学与安全
多智能体系统
摘要
随着 LLM 智能体从数字助手转变为自主系统和机器人中的物理控制器,它们面临着日益加剧的间接提示注入威胁。通过将对抗性指令嵌入工具调用的结果中,攻击者可以劫持智能体的决策过程以执行未授权操作。随着智能体对物理环境获得更多直接控制权,这一漏洞构成了重大风险。针对间接提示注入 (IPI) 的现有防御机制通常分为两类。第一类涉及训练专用检测模型;然而,该方法在训练和推理上均需高昂的计算开销,且需要频繁更新以跟上不断演变的攻击向量。另一种选择是基于提示的方法,利用 LLM 的固有能力通过提示工程检测或忽略恶意指令。尽管具有灵活性,但当前大多数基于提示的防御方法攻击成功率较高,对复杂的注入攻击表现出有限的鲁棒性。在本文中,我们提出了一种新方法,通过工具结果解析为 LLM 提供精确数据,同时有效过滤注入的恶意代码。我们的方法在保持最低攻击成功率的同时,实现了具有竞争力的攻击下效用,显著优于现有方法。代码可在 GitHub 获取。
引用
@article{arxiv.2601.04795,
title = {Defense Against Indirect Prompt Injection via Tool Result Parsing},
author = {Qiang Yu and Xinran Cheng and Chuanyi Liu},
journal= {arXiv preprint arXiv:2601.04795},
year = {2026}
}
备注
20 pages, 3 figures, 5 tables