中文

ProjGuard:基于低维投影的计算机使用代理安全监控

统计计算 2026-05-14 v1

摘要

计算机使用代理正变得越来越有能力在真实操作系统上运行,但这也增加了针对提示注入、间接指令和视觉攻击的风险。现有的防御措施通常依赖于在推理时分析提示或每个潜在恶意输入的第二个大型模型,这会限制覆盖范围或增加部署成本。我们提出了ProjGuard,这是一种基于行为轨迹监控的替代方法。在每一步,我们从代理累积的交互历史中导出轻量级的标量风险信号,并在线评估执行是否开始偏离 toward an unsafe region。这使得在轨迹到达potentially harmful action之前能够提前发出警报。当触发警报时,我们会选择性地激活一个辅助视觉语言模型来提议纠正的下一个步骤并将执行引导回任务完成。在OS-Harm上的实验表明,监控并使用按需纠正可将不安全率从16%降至3%,同时将任务完成率从59%提高到65%。我们进一步评估了在RiosWorld上的迁移效果,其中该方法同样具有竞争力,达到4%不安全和64%完成率。总体而言,这些结果支持一种分层安全策略,其中始终运行的监控可提前预测偏离,并在需要时激活纠正。

关键词

引用

@article{arxiv.2605.13631,
  title  = {ProjGuard: Safety Monitoring for Computer-Use Agents via Low-Dimensional Projections},
  author = {Kebin Contreras and Carlos Hinojosa and Jorge Bacca and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2605.13631},
  year   = {2026}
}