Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs
计算与语言
2026-04-07 v1
摘要
开源框架的快速部署显著推动了现代多智能体系统的发展。然而,扩展的动作空间,包括不可控的特权暴露和隐藏的系统间交互,构成了严峻的安全挑战。具体而言,间接提示注入(Indirect Prompt Injection,IPI)通过隐藏于第三方内容中的恶意指令,可能在正常操作期间触发未授权的动作,如数据泄露。虽然当前的安全评估主要依赖于孤立的单轮基准,但这些智能体在复杂动态环境中的系统性漏洞仍然严重不足。为填补这一差距,我们系统评估了六种防御策略针对四种高级 IPI 攻击向量 across nine LLM backbones。关键的是,我们的评估完全在动态的多步骤工具调用环境中进行,以捕捉现代自主智能体的真实攻击面。超越二元成功率,我们的多维分析揭示了一种显著的脆弱性。高级注入成功地几乎绕过了所有基线防御,一些表面上的缓解措施甚至产生了反生产的副作用。此外,虽然智能体几乎立即执行恶意指令,但其内部状态表现出异常的高决策熵。受此潜在的犹豫启发,我们调查了 Representation Engineering(RepE)作为一种稳健的检测策略。通过提取工具输入位置的隐藏状态,我们发现基于 RepE 的 circuit breaker 成功识别并拦截在智能体提交之前的未授权动作,在 diverse LLM backbones 中实现高检测准确率。这一研究暴露了当前 IPI 防御的局限性,并提供了一种高度实用的构建韧性多智能体架构的范式。
引用
@article{arxiv.2604.03870,
title = {Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs},
author = {Wenhui Zhu and Xuanzhao Dong and Xiwen Chen and Rui Cai and Peijie Qiu and Zhipeng Wang and Oana Frunza and Shao Tang and Jindong Gu and Yalin Wang},
journal= {arXiv preprint arXiv:2604.03870},
year = {2026}
}