中文

别轻信你所读:理解与测度误导性工具描述下的 MCP 行为

密码学与安全 2026-02-04 v1 人工智能

摘要

模型上下文协议(MCP)使大语言模型能够通过自然语言描述调用外部工具,构成许多 AI 智能体应用的基础。然而,MCP 并未强制执行文档化工具行为与实际代码执行之间的一致性,尽管 MCP 服务器常以广泛的系统权限运行。这一差距引入了一种几乎未被探索的安全风险。我们研究了工具描述与底层实现之间的不匹配如何系统性地塑造智能体的心智模型和决策行为。具体而言,我们present了首个针对 MCP 生态系统中描述-代码不一致性的大规模研究。我们设计了一个自动化静态分析框架,并将其应用于 10,240 个真实世界的 MCP 服务器,涵盖 36 个类别。我们的结果表明,虽然大多数服务器高度一致,但约有 13% exhibits 显著的不匹配,可能导致未记录的特权操作、隐藏状态变更或未授权的财务行动。我们进一步观察到在应用类别、流行度水平和 MCP 市场方面存在系统性差异。我们的发现表明,描述-代码不一致性是 MCP 基于 AI 智能体中的一个具体且普遍的攻击面,这激励了未来智能体生态系统中系统性审计和更强透明度保证的需求。

关键词

引用

@article{arxiv.2602.03580,
  title  = {Don't believe everything you read: Understanding and Measuring MCP Behavior under Misleading Tool Descriptions},
  author = {Zhihao Li and Boyang Ma and Xuelong Dai and Minghui Xu and Yue Zhang and Biwei Yan and Kun Li},
  journal= {arXiv preprint arXiv:2602.03580},
  year   = {2026}
}