中文

MPMA:针对模型上下文协议的偏好操纵攻击

密码学与安全 2025-11-12 v2 计算与语言

摘要

模型上下文协议(MCP)标准化了大语言模型(LLM)访问外部数据和工具的接口映射,革新了工具选择范式,促进了LLM代理工具生态的快速扩张。然而,随着MCP的不断采用,第三方定制版本的MCP服务器暴露了潜在的安全漏洞。本文首先引入一种新型安全威胁,称为MCP偏好操纵攻击(MPMA)。攻击者部署定制MCP服务器,通过操纵LLM的优先级选择,使其优先于其他竞争MCP服务器,从而获取经济利益,如来自付费MCP服务的收入或来自免费服务器的广告收入。为实现MPMA,我们首先设计了直接偏好操纵攻击(DPMA),通过插入操纵性词语和短语于工具名称和描述中,实现显著的有效性。然而,这种直接修改对用户而言显而易见,缺乏隐蔽性。为解决这些限制,我们进一步提出了基于遗传算法的广告偏好操纵攻击(GAPMA)。GAPMA采用四种常用策略初始化描述,并整合遗传算法(Genetic Algorithm, GA)以增强隐蔽性。实验结果表明,GAPMA在有效性和隐蔽性之间取得了良好平衡。我们的研究揭示了MCP在开放生态系统中的关键漏洞,凸显了为确保MCP生态公平性的迫切需要强大的防御机制。

关键词

引用

@article{arxiv.2505.11154,
  title  = {MPMA: Preference Manipulation Attack Against Model Context Protocol},
  author = {Zihan Wang and Rui Zhang and Yu Liu and Wenshu Fan and Wenbo Jiang and Qingchuan Zhao and Hongwei Li and Guowen Xu},
  journal= {arXiv preprint arXiv:2505.11154},
  year   = {2025}
}

备注

This is an extended version of the copyrighted publication at AAAI