中文

基于MCP的AI代理的形式化安全框架:威胁分类学、验证模型与防御机制

密码学与安全 2026-04-08 v1 人工智能

摘要

模型上下文协议(MCP)由Anthropic于2024年11月推出,现由Linux基金会代理AI基金会管理,已迅速成为连接基于大语言模型(LLM)的代理与外部工具和数据源的事实标准,月SDK下载量超过9700万次,注册工具超过177000个。然而,这种爆炸式采用暴露了一个关键缺口:缺乏一个统一的、形式化的安全框架,能够系统地描述、分析和缓解MCP代理生态系统面临的多样化威胁。现有的安全研究仍然分散在单篇攻击论文、孤立基准和点防御机制中。本文提出了MCPSHIELD,一个用于基于MCP的AI代理的全面形式化安全框架。我们做出了四项主要贡献:(1)一个层次化威胁分类学,包含7个威胁类别和23个不同攻击向量,分布在四个攻击面上,基于对超过177000个MCP工具的分析;(2)一个基于带信任边界标注的标记转换系统的形式化验证模型,支持对MCP工具交互链的静态和运行时分析;(3)对12种现有防御机制的系统比较评估,识别出威胁分类学中的覆盖缺口;(4)一个纵深防御参考架构,集成了基于能力的访问控制、密码学工具认证、信息流跟踪和运行时策略执行。我们的分析表明,没有任何现有单一防御能覆盖超过34%的已识别威胁格局,而MCPSHIELD的集成架构在理论上实现了91%的覆盖。我们进一步识别了七个开放研究挑战,必须加以解决以保障下一代代理AI系统的安全。

关键词

引用

@article{arxiv.2604.05969,
  title  = {A Formal Security Framework for MCP-Based AI Agents: Threat Taxonomy, Verification Models, and Defense Mechanisms},
  author = {Nirajan Acharya and Gaurav Kumar Gupta},
  journal= {arXiv preprint arXiv:2604.05969},
  year   = {2026}
}