中文

SafePred:面向计算机使用智能体的基于世界模型的预测式安全护栏

计算与语言 2026-02-03 v1 人工智能 机器学习

摘要

随着计算机使用智能体(CUAs)在复杂真实环境中的广泛部署,普遍存在的长期风险常常导致严重且不可逆转的后果。大多数现有针对CUAs的护栏采用反应性方法,仅在当前观测空间内约束智能体行为。虽然这些护栏可以防止即时短期风险(例如点击钓鱼链接),但无法主动避免长期风险:看似合理的行动可能导致延迟显现的高风险后果(例如清除日志会导致未来审计无法追溯),而反应性护栏无法在当前观测空间内识别此类风险。为解决这些限制,我们提出了一种预测式护栏方法,其核心思想是将预测的未来风险与当前决策对齐。基于此方法,我们提出SafePred,这是一种面向CUAs的预测式护栏框架,构建了风险-决策闭环,以确保智能体行为的安全性。SafePred支持两项关键能力:(1)短期和长期风险预测:以安全策略为基础进行风险预测,SafePred利用世界模型的预测能力生成短期和长期风险的语义表示,从而识别并修剪导致高风险状态的行动;(2)决策优化:通过分步骤干预和任务级重新规划,将预测的风险转化为可操作的安全决策指导。大量实验表明,SafePred显著减少了高风险行为,在安全性能方面实现超过97.6%的表现,并相对于反应性基线在任务效用方面提升了最高21.4%。

关键词

引用

@article{arxiv.2602.01725,
  title  = {SafePred: A Predictive Guardrail for Computer-Using Agents via World Models},
  author = {Yurun Chen and Zeyi Liao and Ping Yin and Taotao Xie and Keting Yin and Shengyu Zhang},
  journal= {arXiv preprint arXiv:2602.01725},
  year   = {2026}
}