中文

面向任务的层次化对象分解用于视觉运动控制

机器人学 2024-11-05 v1

摘要

良好的预训练视觉表示可以使机器人高效地学习视觉运动策略。然而,现有的表示采用一刀切的方法,存在两个重要缺点:(1)完全与任务无关,这些表示无法有效忽略场景中的任何任务无关信息;(2)它们通常缺乏表示能力来处理无约束/复杂的真实世界场景。相反,我们提出训练一个由场景实体组织和排列的大规模组合表示族:对象和对象部分。这种面向任务的层次化对象分解(HODOR)允许选择性地组装针对每个任务的不同表示,同时随着场景和任务的复杂性扩展表示能力。在我们的实验中,我们发现HODOR在5个模拟和5个真实世界操作任务上的样本高效模仿学习中优于先前的预训练表示,包括场景向量表示和以对象为中心的表示。我们进一步发现,HODOR中捕获的不变性被继承到下游策略中,这些策略可以鲁棒地泛化到分布外测试条件,允许零样本技能链。附录、代码和视频:https://sites.google.com/view/hodor-corl24。

关键词

引用

@article{arxiv.2411.01284,
  title  = {Task-Oriented Hierarchical Object Decomposition for Visuomotor Control},
  author = {Jianing Qian and Yunshuang Li and Bernadette Bucher and Dinesh Jayaraman},
  journal= {arXiv preprint arXiv:2411.01284},
  year   = {2024}
}