中文

ICON: 基于推理时校正的智能体间接提示注入防御

人工智能 2026-02-25 v1 密码学与安全

摘要

大型语言模型(LLM)智能体容易受到间接提示注入(IPI)攻击,其中检索内容中的恶意指令劫持了智能体的执行。现有的防御通常依赖于严格的过滤或拒绝机制,这些机制存在一个关键限制:过度拒绝,过早地终止有效的智能体工作流。我们提出了ICON,一个从探测到缓解的框架,它在保持任务连续性的同时中和攻击。我们的关键见解是,IPI攻击在潜在空间中留下了独特的过度聚焦特征。我们引入了一个潜在空间痕迹探测器,基于高强度分数来检测攻击。随后,一个缓解校正器执行精细的注意力引导,选择性地操纵对抗性查询键依赖关系,同时放大任务相关元素,以恢复LLM的功能轨迹。在多个骨干模型上的广泛评估表明,ICON实现了具有竞争力的0.4%攻击成功率(ASR),与商业级检测器相当,同时获得了超过50%的任务效用增益。此外,ICON展示了强大的分布外(OOD)泛化能力,并有效扩展到多模态智能体,在安全性和效率之间建立了优越的平衡。

关键词

引用

@article{arxiv.2602.20708,
  title  = {ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction},
  author = {Che Wang and Fuyao Zhang and Jiaming Zhang and Ziqi Zhang and Yinghui Wang and Longtao Huang and Jianbo Gao and Zhong Chen and Wei Yang Bryan Lim},
  journal= {arXiv preprint arXiv:2602.20708},
  year   = {2026}
}

备注

11 pages,