中文

RoboArena:分布式真实世界通用机器人策略评估

机器人学 2025-12-02 v2 机器学习

摘要

全面、无偏且可比的现代通用策略评估方法独一无二地存在挑战:现有机器人基准测试方法通常依赖重型标准化,要么指定固定评估任务和环境,要么举办集中式“机器人挑战”,难以扩展到评估跨广泛任务和环境的通用策略。本文提出 RoboArena,一种用于真实世界通用机器人策略可扩展评估的新方法。我们不围绕固定任务、环境或位置进行标准化评估,而是提出通过分布式评估网络进行众包评估。重要的是,评估者可以自由选择评估的任务和环境,从而轻松实现多样性扩缩,但必须对策略的成对比较进行双盲评估。通过聚合来自不同任务和环境中成对比较的偏好反馈,我们可以推导出策略的排名。我们在七所高校的 DROID 机器人平台上实例化了该方法。通过超过 600 组真实机器人评估情节涉及七种通用策略,我们展示了众包方法在评估现有通用策略性能方面比传统集中式评估方法更准确,同时更可扩展、更具韧性和更可信赖。我们开放评估网络给社区,希望能够实现通用机器人策略的更易访问比较。

关键词

引用

@article{arxiv.2506.18123,
  title  = {RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies},
  author = {Pranav Atreya and Karl Pertsch and Tony Lee and Moo Jin Kim and Arhan Jain and Artur Kuramshin and Clemens Eppner and Cyrus Neary and Edward Hu and Fabio Ramos and Jonathan Tremblay and Kanav Arora and Kirsty Ellis and Luca Macesanu and Marcel Torne Villasevil and Matthew Leonard and Meedeum Cho and Ozgur Aslan and Shivin Dass and Jie Wang and William Reger and Xingfang Yuan and Xuning Yang and Abhishek Gupta and Dinesh Jayaraman and Glen Berseth and Kostas Daniilidis and Roberto Martin-Martin and Youngwoon Lee and Percy Liang and Chelsea Finn and Sergey Levine},
  journal= {arXiv preprint arXiv:2506.18123},
  year   = {2025}
}

备注

Website: https://robo-arena.github.io/