中文

仆从、跟随者、猎手:诚实、有帮助且无害(3H)代理如何开启对抗技能

密码学与安全 2025-08-28 v1 人工智能

摘要

本文识别并分析了基于模型上下文协议 (MCP)的智能体系统中的一种新型漏洞类别。攻击链描述并演示了如何将恰当的、 individually authorized的任务编排以产生有害的涌现行为。通过使用MITRE ATLAS框架进行系统性分析,我们展示了95个测试的智能体(包括浏览器自动化、金融分析、位置跟踪和代码部署等服务)如何将合法操作链接成 sophisticated attack sequences,这些序列超越了任何单个服务的安全边界。这些红队练习调查了当前MCP架构是否缺乏必要的跨域安全措施以检测或防止大类组合攻击。我们提出了具体的攻击链实证证据,实现了通过服务编排实现的针对性伤害,包括数据外泄、金融操纵和基础设施破坏。这些发现表明,服务隔离的根本安全假设在智能体能够跨多个领域协调动作时会失败,导致随着每个额外能力的增加呈指数级增长的攻击面。该研究提供了一个粗糙的实验框架,用于评估智能体是否能够完成MCP基准任务,而不仅仅是它们是否能够完成这些任务,并展示了当它们过好地完成这些任务并在多个服务方面进行优化时会发生什么,这些行为违反了人类期望和安全约束。我们提出了三个具体的实验方向,利用现有的MCP基准套件。

关键词

引用

@article{arxiv.2508.19500,
  title  = {Servant, Stalker, Predator: How An Honest, Helpful, And Harmless (3H) Agent Unlocks Adversarial Skills},
  author = {David Noever},
  journal= {arXiv preprint arXiv:2508.19500},
  year   = {2025}
}