中文

智能体安全的盲点:良性用户指令如何暴露计算机使用智能体的关键漏洞

密码学与安全 2026-04-20 v2 人工智能

摘要

计算机使用智能体(CUA)现在能够在真实的数字环境中自主完成复杂任务,但当被误导时,它们也可能被用于以编程方式自动化有害行为。现有的安全评估主要针对显性威胁,如滥用和提示注入,但忽略了一个微妙而关键的场景:用户指令完全良性,而危害源于任务上下文或执行结果。我们引入了OS-BLIND,一个在非预期攻击条件下评估CUA的基准,包含300个人工设计的任务,涵盖12个类别、8个应用程序和2个威胁集群:环境嵌入威胁和智能体引发的危害。我们对前沿模型和智能体框架的评估显示,大多数CUA的攻击成功率(ASR)超过90%,即使是经过安全对齐的Claude 4.5 Sonnet也达到了73.0%的ASR。更有趣的是,当Claude 4.5 Sonnet部署在多智能体系统中时,这种漏洞变得更加严重,ASR从73.0%上升到92.7%。我们的分析进一步表明,当用户指令是良性时,现有的安全防御措施提供的保护有限。安全对齐主要在前几步被激活,在后续执行过程中很少重新参与。在多智能体系统中,分解的子任务掩盖了模型的恶意意图,导致安全对齐模型失效。我们将发布OS-BLIND,以鼓励更广泛的研究社区进一步调查和解决这些安全挑战。

关键词

引用

@article{arxiv.2604.10577,
  title  = {The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents},
  author = {Xuwei Ding and Skylar Zhai and Linxin Song and Jiate Li and Taiwei Shi and Nicholas Meade and Siva Reddy and Jian Kang and Jieyu Zhao},
  journal= {arXiv preprint arXiv:2604.10577},
  year   = {2026}
}

备注

63 pages