中文

MCPTox:针对真实世界 MCP 服务器的工具投毒攻击基准

密码学与安全 2025-08-22 v1 机器学习

摘要

通过为 LLM 代理提供与外部工具交互的标准化接口,模型上下文协议(MCP)正迅速成为现代自主代理生态系统的基石。然而,由于不受信任的外部工具,它产生了新的攻击面。尽管先前的工作侧重于通过外部工具输出注入的攻击,我们调查了一种更根本的漏洞:工具投毒,即在工具的元数据中嵌入恶意指令而无需执行。迄今为止,这种威胁主要通过孤立案例得到证明,缺乏系统的大规模评估。我们引入了 MCPTox,这是第一个在真实 MCP 环境中系统评估代理对工具投毒鲁棒性的基准。MCPTox 构建于 45 个实时的真实世界 MCP 服务器和 353 个真实工具之上。为此,我们设计了三种不同的攻击模板,通过少样本学习生成了包含 1312 个恶意测试用例的全面套件,涵盖了 10 类潜在风险。我们对 20 个著名 LLM 代理的评估揭示了其对工具投毒的广泛脆弱性,其中 o1-mini 的攻击成功率达到 72.8%。我们发现,能力更强的模型往往更容易受到影响,因为该攻击利用了它们卓越的指令遵循能力。最后,失败案例分析表明,代理很少拒绝这些攻击,最高拒绝率(Claude-3.7-Sonnet)低于 3%,这表明现有的安全对齐对于利用合法工具进行未授权操作的恶意行为是无效的。我们的发现为理解和缓解这一广泛威胁创建了关键的经验基线,并发布 MCPTox 以促进可验证安全的 AI 代理的开发。我们的数据集可在匿名仓库中获取:\textit{https://anonymous.4open.science/r/AAAI26-7C02}。

关键词

引用

@article{arxiv.2508.14925,
  title  = {MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers},
  author = {Zhiqiang Wang and Yichao Gao and Yanting Wang and Suyuan Liu and Haifeng Sun and Haoran Cheng and Guanquan Shi and Haohua Du and Xiangyang Li},
  journal= {arXiv preprint arXiv:2508.14925},
  year   = {2025}
}