RoboCerebra:用于长期机器人操作评估的大规模基准
机器人学
2025-10-30 v2 计算机视觉与模式识别
摘要
近期视觉-语言模型(VLM)的进展使以指令为导向的机器人系统获得了 improved 的泛化能力。然而,大多数现有工作集中于反应式System 1策略, underutilizing VLM在语义推理和长期计划方面的优势。这些System 2能力——以 deliberative、以目标为导向的思考为特征——由于当前基准的有限时间尺度和结构复杂性而未得到充分探索。为填补这一空白,我们引入RoboCerebra,用于评估长期机器人操作中高级推理的基准。RoboCerebra包括:(1)具有扩展任务时限和多样化子任务序列的大规模仿真数据集,置于家庭环境中;(2)一种层次框架,将高级VLM计划器与低级视觉-语言-动作(VLA)控制器组合在一起;以及(3)针对计划、反思和记忆,通过结构化System 1-System 2相互作用的评估协议。该数据集通过一种自上而下的管道构建,其中GPT生成任务指令并分解为子任务序列。人类操作员在仿真中执行子任务,产生高质量轨迹,包含动态对象变化。与先前的基准相比,RoboCerebra具有显著更长的动作序列和更密集的注释。我们进一步对最先进的VLM作为System 2模块进行基准测试,并分析其在关键认知维度上的表现,推动了更具能力和更广泛可泛化的机器人计划器的发展。
引用
@article{arxiv.2506.06677,
title = {RoboCerebra: A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation},
author = {Songhao Han and Boxiang Qiu and Yue Liao and Siyuan Huang and Chen Gao and Shuicheng Yan and Si Liu},
journal= {arXiv preprint arXiv:2506.06677},
year = {2025}
}
备注
25 pages, 18 figures, Accepted by NeurIPS 2025