从提示注入到协议漏洞:LLM 驱动 AI 代理工作流程中的威胁
密码学与安全
2025-12-16 v2 人工智能
摘要
由大型语言模型(LLM)驱动的自主 AI 代理配备结构化函数调用接口,使其能够实现实时数据检索、计算和多步骤编排。然而,插件、连接器和代理间协议的快速增长已超过安全实践的步伐,导致集成脆弱,依赖临时身份验证、一致性较差的模式定义和弱验证。本综述引入了 LLM 代理生态系统的统一端到端威胁模型,涵盖主机到工具和代理到代理之间的通信。我们系统性地归类了超过三十种攻击技术,包括输入操控、模型破坏、系统和隐私攻击以及协议层漏洞。对于每一类别,我们提供了形式化的威胁表述,定义了攻击者的能力、目标以及受影响的系统层。代表性示例包括 Prompt-to-SQL 注入和 GitHub MCP 服务器中的 Toxic Agent Flow 漏洞。我们分析了攻击的可行性,回顾了现有防御措施,并讨论了动态信任管理、加密来源跟踪和沙箱化代理接口等缓解策略。该框架通过专家审阅以及与实际事件和公共漏洞存储库(包括 CVE 和 NIST NVD)的交叉映射得到验证。与以往的调查工作相比,本工作首次将输入层漏洞和协议层漏洞在 LLM 代理生态系统中集成化归类,为设计安全和有韧性的代理 AI 系统提供可操作的指导。
引用
@article{arxiv.2506.23260,
title = {From Prompt Injections to Protocol Exploits: Threats in LLM-Powered AI Agents Workflows},
author = {Mohamed Amine Ferrag and Norbert Tihanyi and Djallel Hamouda and Leandros Maglaras and Abderrahmane Lakas and Merouane Debbah},
journal= {arXiv preprint arXiv:2506.23260},
year = {2025}
}
备注
The paper is published in ICT Express (Elsevier)