中文

LLM能从MCP服务器系统日志中推断风险信息吗?

计算机视觉与模式识别 2025-11-11 v1

摘要

大型语言模型 (LLM) 在集成外部工具后展现出解决复杂任务的强大能力。模型上下文协议 (MCP) 已成为启用此类工具交互的标准接口。然而,这些交互引入了重大的安全问题,特别是当MCP服务器被破解或不可信时。虽然先前的基准主要关注提示注入攻击或分析LLM-MCP交互轨迹的漏洞,但对与恶意MCP服务器相关的底层系统日志所关注的 attention has been limited. 为填补这一差距,我们提出了第一个用于评估LLM识别系统日志中安全风险的合成基准。我们定义了九类MCP服务器风险,并使用十个前沿LLM生成 1,800 条合成系统日志。这些日志嵌入到 243 个精选MCP服务器的返回值中,形成用于训练的 2,421 条聊天记录和 471 条查询的评估数据集。我们的初步实验表明,较小的模型常常未能检测风险系统日志,导致高假阴性。虽然使用监督微调 (SFT) 的模型倾向于过度标记良性日志,导致假阳性率升高,但基于可验证奖励的强化学习 (RLVR) 在精确率和召回率之间取得了更好的平衡。特别是,在使用组相对策略优化 (GRPO) 训练后,Llama3.1-8B-Instruct 实现了 83% 的准确率,超越最佳性能的远程大型模型 9 个百分点。细粒度的按类别分析进一步凸显了强化学习在提升MCP框架内LLM安全性方面的有效性。代码和数据可在 https://github.com/PorUna-byte/MCP-RiskCue 提供。

关键词

引用

@article{arxiv.2511.05866,
  title  = {Light-Field Dataset for Disparity Based Depth Estimation},
  author = {Suresh Nehra and Aupendu Kar and Jayanta Mukhopadhyay and Prabir Kumar Biswas},
  journal= {arXiv preprint arXiv:2511.05866},
  year   = {2025}
}

备注

This paper has been accepted to ACM ICVGIP 2025