MCP 安全训练:利用改进的偏好对齐学习拒绝虚假良性 MCP 漏洞利用
机器学习
2025-05-30 v1 密码学与安全
摘要
模型上下文协议(MCP)作为一种开放标准被广泛采用,以实现生成式 AI 智能体的无缝集成。然而,最近的工作表明,MCP 容易受到基于检索的“虚假良性”攻击(FBAs),允许恶意系统访问和凭证窃取,但要求用户将受损文件直接下载到其系统中。在此我们表明,基于 MCP 的攻击的威胁模型比先前认为的要广泛得多,即攻击者只需在线发布恶意内容即可欺骗 MCP 智能体在不知情受害者的系统上执行攻击。为了改进针对此类攻击的对齐护栏,我们引入了一个包含 FBAs 和(真正的)良性样本的新 MCP 数据集,以探索直接偏好优化(DPO)在大语言模型(LLMs)拒绝训练中的有效性。虽然 DPO 改进了模型针对此类攻击的护栏,但我们表明,拒绝学习的有效性因模型的原始训练后对齐方案而异——例如,基于 GRPO 的 LLMs 学习拒绝的能力极差。因此,为了进一步改进对 FBAs 的拒绝,我们引入了用于偏好对齐的检索增强生成(RAG-Pref),这是一种基于 RAG 的新型偏好对齐策略。我们表明,RAG-Pref 显著提高了 LLMs 拒绝 FBAs 的能力,特别是与 DPO 对齐结合使用时,从而极大地改善了针对基于 MCP 攻击的护栏。
引用
@article{arxiv.2505.23634,
title = {MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment},
author = {John Halloran},
journal= {arXiv preprint arXiv:2505.23634},
year = {2025}
}
备注
27 pages, 19 figures, 4 tables