ClevrSkills:机器人学中的组合语言与视觉推理
机器人学
2024-11-15 v1 机器学习
摘要
机器人任务本质上高度组合化。例如,要执行清理桌面等高层任务,机器人必须运用移动末端执行器至桌面物体、抓取它们并逐个移出桌面等低层能力,同时在过程中重新评估随之而来的动态场景。鉴于大型视觉语言模型(VLM)在许多需要高层、类人推理的任务上取得进展,我们提出问题:如果教授模型所需的低层能力,它们能否以新颖方式组合这些能力,以实现清理桌面等有趣的高层任务,而无需显式教授?为此,我们提出ClevrSkills——一个面向机器人学组合推理的基准套件。ClevrSkills是建立在ManiSkill2模拟器之上的环境套件及其配套数据集。数据集包含在一系列机器人任务上生成的轨迹,带有语言与视觉标注以及作为任务规范的多模态提示。该套件包含三个组合理解层级的任务课程,从需要基本运动技能的简单任务开始。我们在ClevrSkills上对多个不同的VLM基线进行基准测试,并表明即使在大量任务上预训练后,这些模型在机器人任务的组合推理上仍会失败。
引用
@article{arxiv.2411.09052,
title = {ClevrSkills: Compositional Language and Visual Reasoning in Robotics},
author = {Sanjay Haresh and Daniel Dijkman and Apratim Bhattacharyya and Roland Memisevic},
journal= {arXiv preprint arXiv:2411.09052},
year = {2024}
}
备注
To appear at NeurIPS 2024 (D&B track)