中文

ClevrSkills:机器人学中的组合语言与视觉推理

机器人学 2024-11-15 v1 机器学习

摘要

机器人任务本质上高度组合化。例如,要执行清理桌面等高层任务,机器人必须运用移动末端执行器至桌面物体、抓取它们并逐个移出桌面等低层能力,同时在过程中重新评估随之而来的动态场景。鉴于大型视觉语言模型(VLM)在许多需要高层、类人推理的任务上取得进展,我们提出问题:如果教授模型所需的低层能力,它们能否以新颖方式组合这些能力,以实现清理桌面等有趣的高层任务,而无需显式教授?为此,我们提出ClevrSkills——一个面向机器人学组合推理的基准套件。ClevrSkills是建立在ManiSkill2模拟器之上的环境套件及其配套数据集。数据集包含在一系列机器人任务上生成的轨迹,带有语言与视觉标注以及作为任务规范的多模态提示。该套件包含三个组合理解层级的任务课程,从需要基本运动技能的简单任务开始。我们在ClevrSkills上对多个不同的VLM基线进行基准测试,并表明即使在大量任务上预训练后,这些模型在机器人任务的组合推理上仍会失败。

关键词

引用

@article{arxiv.2411.09052,
  title  = {ClevrSkills: Compositional Language and Visual Reasoning in Robotics},
  author = {Sanjay Haresh and Daniel Dijkman and Apratim Bhattacharyya and Roland Memisevic},
  journal= {arXiv preprint arXiv:2411.09052},
  year   = {2024}
}

备注

To appear at NeurIPS 2024 (D&B track)