评估通用机器人操作策略的分类法
机器人学
2026-02-09 v3 人工智能
机器学习
摘要
机器学习用于机器人操作有望解锁对新任务和环境的泛化能力。但我们应如何衡量这些策略在泛化方面的进展?评估和量化泛化是现代机器人学的'荒野地带',每项工作都提出并测量不同类型的泛化,且往往在各自难以复现的设置中进行。在这项工作中,我们的目标是(1)以全面且细致的方式概述我们认为对机器人操作重要的泛化形式,(2)提供测量这些泛化概念的复现性指南。我们首先提出 STAR-Gen,一个围绕视觉、语义和行为泛化构建的机器人操作泛化分类法。接下来,我们通过两个基于真实世界基准测试的案例研究来实例化 STAR-Gen:一个基于开源模型和 Bridge V2 数据集,另一个基于覆盖更灵巧和更长时序任务的双臂 ALOHA 2 平台。我们的案例研究揭示了许多有趣的见解:例如,我们观察到开源视觉-语言-动作模型尽管在互联网规模语言数据集上预训练,但通常在语义泛化方面表现不佳。我们在 stargen-taxonomy.github.io 提供了视频和其他补充材料。
引用
@article{arxiv.2503.01238,
title = {A Taxonomy for Evaluating Generalist Robot Manipulation Policies},
author = {Jensen Gao and Suneel Belkhale and Sudeep Dasari and Ashwin Balakrishna and Dhruv Shah and Dorsa Sadigh},
journal= {arXiv preprint arXiv:2503.01238},
year = {2026}
}
备注
IEEE Robotics and Automation Letters (RA-L)