面向IPI中心LLM代理防御框架的分类学、评估与利用
密码学与安全
2025-11-20 v1 人工智能
摘要
具有函数调用能力的大语言模型(LLM)代理正在日益增长地部署,但仍然容易受到劫持其工具调用的间接注入(IPI)攻击。作为应对,众多IPI中心防御框架涌现。然而,这些防御措施碎片化,缺乏统一的分类学和全面评估。在本Systematization of Knowledge(SoK)论文中,我们首次对IPI中心防御框架进行全面分析。我们提出了这些防御的全面分类学,将其沿五个维度进行划分。随后我们全面评估了代表性防御框架的安全性和可用性。通过分析评估中的防御失效,我们识别出六个防御规避的根本原因。基于这些发现,我们设计了三种新型自适应攻击,以显著提高针对特定框架的攻击成功率,揭示了这些防御框架严重缺陷的严重性。我们的论文为未来开发更安全和可用性更好的IPI中心代理防御框架提供了基础和关键见解。
引用
@article{arxiv.2511.15203,
title = {Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks},
author = {Zimo Ji and Xunguang Wang and Zongjie Li and Pingchuan Ma and Yudong Gao and Daoyuan Wu and Xincheng Yan and Tian Tian and Shuai Wang},
journal= {arXiv preprint arXiv:2511.15203},
year = {2025}
}