中文

Attested Tool-Server Admission:模型上下文协议的安全扩展

计算与语言 2026-05-26 v1 人工智能

摘要

模型上下文协议(MCP)标准化了大型语言模型(LLM)代理与外部工具服务器之间的消息交换,但不涉及信任:主机读取服务器自声明的工具列表并分派调用,没有关于主机可能使用的服务器、敏感性或服务器工具是否在范围内的概念。该工作源于一个具体需求——让Enclawed agent能够安全地使用Google外部运营的MCP服务器(Gmail、日历、Drive),在不更改MCP或Enclawed自身工具应用程序编程接口(API)的情况下,承认该服务器并限制其可驱动的工具。我们构建的机制(mcp-attested),已在开源enclawed-oss发行版和enclaved风格中发布,具有普遍适用性:使一个用户的无中介第三方连接不安全的差距,使得受监管的部署难以认证。我们通过三个增量机制来解决该问题:(1)一个小型、离线签名的清楚声明,服务器在已知统一资源标识符(URI)下发布,主机在任何工具调度之前都与固定的信任根进行验证;(2)按服务器默认拒绝的工具允许列表,以承认服务器不等于信任其所有工具;(3)一种风味受控的执行模式,将检查从警告转换为硬性拒绝,所有决定都写入防篡改审计日志。我们提供了线缆格式、验证算法、安全分析和LLM驱动的对抗性评估;然后我们以规范性请求评论(RFC 2119)形式阐述设计——模式、验证规则、错误注册表、已知注册和机器可检查的合规向量——以便其可作为MCP补充而非重新发明。未扩展的主机会忽略已知文档并按今天的方式正常工作。

关键词

引用

@article{arxiv.2605.24247,
  title  = {Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation},
  author = {Konstantin Berlin and Adam Swanda},
  journal= {arXiv preprint arXiv:2605.24247},
  year   = {2026}
}

备注

Under review at ACL Rolling Review (ARR), May 2026 cycle. Also available at https://doi.org/10.5281/zenodo.20125267