中文

面向不可信 AI 代理的控制协议评估

计算机视觉与模式识别 2025-11-06 v1

摘要

随着 AI 系统变得更加强大且广泛部署为代理,确保其安全操作变得至关重要。AI 控制提供了一种方法来缓解来自不可信 AI 代理的风险,通过监控其动作并在必要时进行干预或审计。评估这些协议的安全性需要理解其对当前攻击的有效性以及对自适应对手的鲁棒性。在本工作中,我们系统评估了 SHADE-Arena 中 diverse agentic 环境中的一系列控制协议。首先,我们评估了蓝队协议,包括对受信任模型的推迟、重新抽样以及对关键动作的推迟,以针对默认攻击策略。我们发现针对 incrimination 的重新抽样以及对关键动作的推迟表现最佳,将安全性从50%提高到96%。我们 then 迭代对这些协议进行红队策略测试,发现具备额外功能的攻击策略,如了解何时进行重新抽样或能够模拟监控器的能力,可显著提高对我们重新抽样策略的攻击成功率,将安全性降低到17%。然而,对关键动作的推迟对即使我们最强的红队策略也高度稳健,表明阻止攻击策略获取协议内部信息的重要性。

关键词

引用

@article{arxiv.2511.02996,
  title  = {SCALE-VLP: Soft-Weighted Contrastive Volumetric Vision-Language Pre-training with Spatial-Knowledge Semantics},
  author = {Ailar Mahdizadeh and Puria Azadi Moghadam and Xiangteng He and Shahriar Mirabbasi and Panos Nasiopoulos and Leonid Sigal},
  journal= {arXiv preprint arXiv:2511.02996},
  year   = {2025}
}