AutoEval:现实世界中通用机器人操作策略的自主评估
机器人学
2025-04-04 v2 人工智能
摘要
可扩展且可复现的策略评估一直是机器人学习中长期存在的挑战。评估对于评估进展和构建更好的策略至关重要,但在现实世界中进行评估,尤其是在能够提供统计可靠结果的规模上,既耗费大量人力又难以实现。对日益通用的机器人策略进行评估需要越来越多样化的评估环境,这使得评估瓶颈更加凸显。为了使机器人策略的现实世界评估更加实用,我们提出了 AutoEval,这是一个以最少人工干预全天候自主评估通用机器人策略的系统。用户通过向 AutoEval 队列提交评估作业与 AutoEval 交互,就像使用集群调度系统提交软件作业一样,AutoEval 将在一个提供自动成功检测和自动场景重置的框架内调度策略进行评估。我们表明 AutoEval 几乎可以完全消除评估过程中的人工参与,允许进行全天候评估,并且评估结果与手动进行的真实评估高度一致。为了促进机器人社区对通用策略的评估,我们在流行的 BridgeData 机器人设置中提供了使用 WidowX 机械臂的多个 AutoEval 场景的公开访问。未来,我们希望 AutoEval 场景能够在各机构间建立,形成一个多样化且分布式的评估网络。
引用
@article{arxiv.2503.24278,
title = {AutoEval: Autonomous Evaluation of Generalist Robot Manipulation Policies in the Real World},
author = {Zhiyuan Zhou and Pranav Atreya and You Liang Tan and Karl Pertsch and Sergey Levine},
journal= {arXiv preprint arXiv:2503.24278},
year = {2025}
}