RoboJailBench:面向具身化机器人智能体的对抗性攻击与防御基准测试
密码学与安全
2026-05-20 v1 机器人学
摘要
近期在视觉语言模型(VLM)方面的进展推动了一类新的具身化人工智能系统的出现,这些模型被集成到物理平台(如机器人和自动驾驶车辆)中,用于在多样化环境中解释视觉场景并执行自然语言指令。然而,现有研究虽已引入针对具身化 AI 的越狱攻击与防御方法,但其评估依赖于非标准化数据集、有限的指标,并强调攻击成功率,却忽视了安全性与遵循良性指令能力之间的权衡。现有的基准测试和评估框架要么针对传统聊天式模型,要么侧重于具身化 AI 的非对抗安全评估;两者都未能捕捉具身化 AI 系统中越狱攻击所必需的风险、输入、后果与评估标准。本文提出了 RoboJailBench 以弥补这一空白。该基准由三个核心组件构成:我们从 ISO 标准、监管规则和已记录事件中建立了安全分类学,得出 18 类具身化 AI 安全违规后果。我们引入意图对比数据集管道,通过添加配对的对抗性与良性目标来衡量安全性与实用性。最后,我们提供了一个不断演进的存储库,包含标准化指标以及统一的评估与集成新攻击与防御的方法。通过该基准,我们构建了新的分类平衡数据集,并扩展了五个现有数据集。我们集成了四种攻击方法和两种防御策略,对评估领先具身化 VLM 的性能。本基准提供了具身化 AI 越狱攻击的首个标准化评估框架,支持未来研究。我们发布代码、数据集和相关资产,并在 https://purseclab.github.io/benchmark-for-robotics-security 上维护排行榜。
引用
@article{arxiv.2605.19328,
title = {RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents},
author = {Doguhuan Yeke and Yanming Zhou and Leo Y. Lin and Hongyu Cai and Antonio Bianchi and Z. Berkay Celik},
journal= {arXiv preprint arXiv:2605.19328},
year = {2026}
}