中文

生成机器人宪法与基准以实现语义安全

机器人学 2025-03-12 v1 人工智能 计算机视觉与模式识别 计算机与社会 人机交互

摘要

直到最近,机器人安全研究主要关注机器人附近区域的碰撞避免和危险降低。随着大型视觉语言模型(VLM)的出现,机器人现在也具备更高层次的语义场景理解能力和与人类的自然语言交互。尽管VLM存在已知漏洞(如幻觉或越狱),但它们正被赋予控制能够与现实世界进行物理接触的机器人的能力,这可能导致危险行为,使机器人的语义安全成为紧迫问题。本文的贡献有两方面:第一,为应对这些新兴风险,我们发布了ASIMOV基准——一个用于评估和提升作为机器人大脑的基础模型语义安全的大规模综合性数据集集合。我们的数据生成方案具有高度可扩展性:通过利用文本和图像生成技术,我们从真实世界视觉场景和医院人体伤害报告中生成不理想的情境。其次,我们开发了一个框架,从真实世界数据自动生成机器人宪法,利用宪法AI机制来引导机器人行为。我们提出了一种新颖的自动修正过程,能够在书面的行为规则中引入细微差别,从而提升与人类在行为可取性和安全性方面的偏好一致性。我们在ASIMOV基准上探索了不同长度宪法在通用性与特异性之间的权衡,并证明机器人能够有效拒绝违宪行为。使用生成宪法,我们在ASIMOV基准上测得84.3%的顶级对齐率,优于无宪法基线和人工编写宪法。数据可在asimov-benchmark.github.io获取。

关键词

引用

@article{arxiv.2503.08663,
  title  = {Generating Robot Constitutions & Benchmarks for Semantic Safety},
  author = {Pierre Sermanet and Anirudha Majumdar and Alex Irpan and Dmitry Kalashnikov and Vikas Sindhwani},
  journal= {arXiv preprint arXiv:2503.08663},
  year   = {2025}
}