中文

MirrorGuard:通过仿真到现实推理纠正实现安全计算机使用智能体

人工智能 2026-01-21 v1

摘要

大型基础模型集成到计算机使用智能体(CUA)中,使其能够通过图形用户界面(GUI)与操作系统进行自治交互,以执行复杂任务。这种自治性引入了严重的安全风险:恶意指令或视觉注入可触发不安全的推理并导致有害的系统级操作。现有的防御措施,如基于检测的阻塞,虽可防止损坏,但常常过早中止任务,降低智能体的实用性。在本文中,我们提出了 MirrorGuard,一个即插即用的防御框架,使用仿真式训练来提高 CUA 在现实世界中的安全性。为降低在操作系统中大规模训练的成本,我们提出了一种新型神经符号仿真管道,该管道在文本化模拟环境中生成逼真的、高风险的 GUI 交互轨迹,而无需实际执行操作。这捕获了不安全的推理模式和潜在的系统危险。在仿真环境中,MirrorGuard 学习在 CUA 产生并执行不安全操作之前拦截和纠正不安全的推理链。在现实世界的测试中,广泛的评估跨越多样化的基准和 CUA 架构,表明 MirrorGuard 显著缓解了安全风险。例如,在 ByteDance UI-TARS 系统上,它将不安全率从66.5%降至13.0%,同时保持边缘的假拒绝率(FRR)。与最先进的 GuardAgent 相比,后者仅将不安全率降至53.9%,且FRR高出15.4%。我们的工作证明,仿真派生的防御可以在保持智能体基本实用性的同时,提供稳健的现实世界保护。我们的代码和模型已公开发布于https://bmz-q-q.github.io/MirrorGuard/。

关键词

引用

@article{arxiv.2601.12822,
  title  = {MirrorGuard: Toward Secure Computer-Use Agents via Simulation-to-Real Reasoning Correction},
  author = {Wenqi Zhang and Yulin Shen and Changyue Jiang and Jiarun Dai and Geng Hong and Xudong Pan},
  journal= {arXiv preprint arXiv:2601.12822},
  year   = {2026}
}