中文

AGENTSAFE:基于危险指令评估具象智能体安全性的基准

密码学与安全 2025-10-21 v3 机器人学

摘要

视觉语言模型(VLM)的集成正在推动具象智能体在以人为本的环境中运行的新一代能力。然而,随着部署范围的扩大,这些系统面临日益增长的安全风险,尤其是在执行危险指令时。当前的安全评估基准仍有限:它们仅覆盖狭窄的危险范围,主要关注最终结果,忽略了智能体完整的感知-规划-执行过程,从而掩盖了关键的失效模式。因此,我们提出了 SAFE,一个用于系统性评估具象 VLM 智能体在危险指令上的安全性的基准。SAFE 包含三个组件:SAFE-THOR,一个可扩展的对抗模拟沙盒,配备通用适配器,将高级 VLM 输出映射到低级具象控制,支持多样化的智能体工作流程集成;SAFE-VERSE,一个受阿斯米诺《机器人三定律》启发的风险感知任务套件,包含 45 个对抗场景、1350 个危险任务和 9900 条指令,涵盖对人类、环境和智能体本身的风险;以及 SAFE-DIAGNOSE,一个多层次、精细的评估协议,衡量智能体在感知、规划和执行方面的性能。将 SAFE 应用于九个最先进的 VLM 和两个具象智能体工作流程,我们发现将危险识别转化为安全规划和执行存在系统性失效。我们的发现揭示了当前安全对齐的根本局限,表明为开发更安全的具象智能所需全面的多阶段评估。

关键词

引用

@article{arxiv.2506.14697,
  title  = {AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions},
  author = {Zonghao Ying and Le Wang and Yisong Xiao and Jiakai Wang and Yuqing Ma and Jinyang Guo and Zhenfei Yin and Mingchuan Zhang and Aishan Liu and Xianglong Liu},
  journal= {arXiv preprint arXiv:2506.14697},
  year   = {2025}
}