中文

当手册说谎时:评估针对LLM智能体的MCP投毒攻击的现实基准

密码学与安全 2026-05-26 v1 人工智能

摘要

使用工具的大型语言模型(LLM)智能体的兴起,通过模型上下文协议(MCP)等协议实现了标准化,通过集成外部开放领域知识和工具,为LLM智能体解锁了前所未有的自主执行能力。然而,这种互操作性引入了一个针对智能体认知规划层的隐蔽攻击面。本文系统地研究了工具描述投毒(TDP),一种新颖的语义攻击。在TDP中,恶意指令并非嵌入工具的可执行代码中,而是隐蔽地注入其描述性元数据——即智能体进行安全规划和决策所依赖的“手册”。为了严格且系统地评估这一新兴威胁,我们引入了MCP-TDP安全基准。这个高保真沙箱环境包含32个跨越6个不同风险类别的真实世界测试用例。我们对8个主流LLM的评估揭示了严重的漏洞,领先模型如GPT-4o在六个高风险场景中表现出接近100%的攻击成功率(ASR)。此外,我们的发现表明,常见的提示防护栏防御措施基本无效,并且可能适得其反(我们称之为“防火墙谬误”的现象)。至关重要的是,我们还提出了一种防御机制:“反应性自我修正”,即智能体在执行后自主检测并撤销其自身的恶意行为。这项工作为TDP提供了首个专门的安全基准,为保护高级智能体系统的认知和规划层提供了重要见解。

关键词

引用

@article{arxiv.2605.24069,
  title  = {When the Manual Lies: A Realistic Benchmark to Evaluate MCP Poisoning Attacks for LLM Agents},
  author = {Shi Liu and Xuehai Tang and Xikang Yang and Liang Lin and Biyu Zhou and Wenjie Xiao and Wantao Liu},
  journal= {arXiv preprint arXiv:2605.24069},
  year   = {2026}
}