THE COLOSSEUM:一个用于评估机器人操作泛化能力的基准
机器人学
2024-05-29 v2 人工智能
机器学习
摘要
为了实现有效的大规模真实世界机器人应用,我们必须评估机器人策略对环境条件变化的适应能力。然而,大多数研究在与训练设置高度相似甚至完全相同的环境中评估机器人性能。我们提出了 THE COLOSSEUM,一个包含 20 个多样化操作任务的新型仿真基准,能够沿 14 个环境扰动轴对模型进行系统性评估。这些扰动包括物体、桌面和背景的颜色、纹理和尺寸的变化;我们还改变了光照、干扰物、物理属性扰动和相机位姿。使用 THE COLOSSEUM,我们比较了 5 个 state-of-the-art 操作模型,发现在这些扰动因素下它们的成功率下降了 30-50%。当同时施加多种扰动时,成功率下降 75%。我们发现,改变干扰物体数量、目标物体颜色或光照条件是降低模型性能最严重的扰动。为了验证结果的生态效度,我们展示了仿真结果与真实世界实验中的类似扰动具有相关性()。我们开源了代码供他人使用 THE COLOSSEUM,并发布了用于 3D 打印物体的代码,以复现真实世界的扰动。最终,我们希望 THE COLOSSEUM 能作为一个基准,以识别那些能系统性提升操作泛化能力的建模决策。详情请见 https://robot-colosseum.github.io/。
引用
@article{arxiv.2402.08191,
title = {THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation},
author = {Wilbert Pumacay and Ishika Singh and Jiafei Duan and Ranjay Krishna and Jesse Thomason and Dieter Fox},
journal= {arXiv preprint arXiv:2402.08191},
year = {2024}
}
备注
RSS 2024. 33 pages