中文

HASARD:面向具身智能体基于视觉的安全强化学习基准

人工智能 2025-03-12 v1 计算机视觉与模式识别 机器学习 机器人学

摘要

通过强化学习(RL)推进安全自主系统的发展,需要稳健的基准来评估性能、分析方法并评估智能体能力。人类主要依赖具身视觉感知来安全地导航和与其周围环境交互,这使其成为 RL 智能体的一项重要能力。然而,现有的基于视觉的 3D 基准仅考虑简单的导航任务。为了弥补这一不足,我们引入了 HASARD,这是一套多样化且复杂的任务集,旨在利用 Doom 推进安全强化学习,需要战略决策、理解空间关系以及预测短期未来。HASARD 具有三个难度级别和两个动作空间。对流行基线方法的实证评估证明了该基准的复杂性、独特挑战以及奖励-成本权衡。在训练期间使用自上而下的热力图可视化智能体导航,为了解方法的学习过程提供了深刻见解。跨难度级别的渐进式训练提供了一种隐式学习课程。HASARD 是第一个专门针对基于自我中心视觉学习的安全 RL 基准,提供了一种经济高效且富有洞察力的方式来探索当前和未来安全 RL 方法的潜力与边界。环境和基线实现已在 https://sites.google.com/view/hasard-bench/ 上开源。

关键词

引用

@article{arxiv.2503.08241,
  title  = {HASARD: A Benchmark for Vision-Based Safe Reinforcement Learning in Embodied Agents},
  author = {Tristan Tomilin and Meng Fang and Mykola Pechenizkiy},
  journal= {arXiv preprint arXiv:2503.08241},
  year   = {2025}
}

备注

Accepted to ICLR 2025