中文

GHIL-Glue:基于过滤子目标图像的分层控制

机器人学 2024-10-29 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

在互联网规模数据上预训练的图像和视频生成模型可以极大提升机器人学习系统的泛化能力。这些模型可以作为高层规划器,为低层目标条件策略生成中间子目标以供其到达。然而,这些系统的性能可能会受到生成模型与低层控制器之间接口的严重制约。例如,生成模型可能预测出逼真但在物理上不可行的帧,从而干扰低层策略。低层策略也可能对生成目标图像中微妙的视觉伪影敏感。本文解决了泛化问题的这两个方面,提供了一个接口,以有效地将语言条件的图像或视频预测模型与低层目标条件策略“粘合”在一起。我们的方法,即生成式分层模仿学习-粘合(Generative Hierarchical Imitation Learning-Glue, GHIL-Glue),过滤掉不会带来任务进展的子目标,并提高了目标条件策略对带有有害视觉伪影的生成子目标的鲁棒性。我们在模拟和真实环境中的大量实验中发现,GHIL-Glue 在多个利用生成子目标的分层模型上实现了 25% 的性能提升,在 CALVIN 模拟基准测试上,针对使用单 RGB 摄像头观测的策略达到了新的 SOTA。在测试零样本泛化能力的物理实验中,GHIL-Glue 在 4 项语言条件操作任务中的 3 项上也优于其他通用机器人策略。

关键词

引用

@article{arxiv.2410.20018,
  title  = {GHIL-Glue: Hierarchical Control with Filtered Subgoal Images},
  author = {Kyle B. Hatch and Ashwin Balakrishna and Oier Mees and Suraj Nair and Seohong Park and Blake Wulfe and Masha Itkina and Benjamin Eysenbach and Sergey Levine and Thomas Kollar and Benjamin Burchfiel},
  journal= {arXiv preprint arXiv:2410.20018},
  year   = {2024}
}

备注

Code, model checkpoints and videos can be found at https://ghil-glue.github.io