生成图像作为动作模型
机器人学
2024-10-10 v2 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
图像生成扩散模型已微调以解锁新的功能,例如图像编辑和新视角合成。我们能否类似地为视觉-运动控制解锁图像生成模型?我们提出了 GENIMA,一种行为克隆智能体,通过微调 Stable Diffusion 来在 RGB 图像上“绘制关节动作”作为目标。将这些图像输入到控制器中,将视觉目标映射为关节位置序列。我们在 25 个 RLBench 和 9 个真实世界操作任务上研究了 GENIMA。我们发现,通过将动作提升到图像空间,internet 预训练的扩散模型可以生成超越现有视觉-运动方法的策略,尤其在对场景扰动的鲁棒性和对新对象的泛化方面表现更好。我们的 метод也与 3D 智能体竞争,尽管缺乏深度、关键点或运动规划器等先验条件。
引用
@article{arxiv.2407.07875,
title = {Generative Image as Action Models},
author = {Mohit Shridhar and Yat Long Lo and Stephen James},
journal= {arXiv preprint arXiv:2407.07875},
year = {2024}
}
备注
CoRL 2024. Website, code, checkpoints: https://genima-robot.github.io/