中文

生成图像作为动作模型

机器人学 2024-10-10 v2 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

图像生成扩散模型已微调以解锁新的功能,例如图像编辑和新视角合成。我们能否类似地为视觉-运动控制解锁图像生成模型?我们提出了 GENIMA,一种行为克隆智能体,通过微调 Stable Diffusion 来在 RGB 图像上“绘制关节动作”作为目标。将这些图像输入到控制器中,将视觉目标映射为关节位置序列。我们在 25 个 RLBench 和 9 个真实世界操作任务上研究了 GENIMA。我们发现,通过将动作提升到图像空间,internet 预训练的扩散模型可以生成超越现有视觉-运动方法的策略,尤其在对场景扰动的鲁棒性和对新对象的泛化方面表现更好。我们的 метод也与 3D 智能体竞争,尽管缺乏深度、关键点或运动规划器等先验条件。

关键词

引用

@article{arxiv.2407.07875,
  title  = {Generative Image as Action Models},
  author = {Mohit Shridhar and Yat Long Lo and Stephen James},
  journal= {arXiv preprint arXiv:2407.07875},
  year   = {2024}
}

备注

CoRL 2024. Website, code, checkpoints: https://genima-robot.github.io/