中文

VidMan: 利用视频扩散模型中的隐式动力学实现高效机器人操作

计算机视觉与模式识别 2024-11-15 v1 机器人学

摘要

利用大规模视频数据学习视频生成模型的最新进展展示了在理解复杂物理动力学方面的巨大潜力。这表明利用多样化的机器人轨迹数据开发统一的、动力学感知的模型以增强机器人操作是可行的。然而,鉴于可用机器人数据量相对较小,若不考虑视觉观测与动作之间的关系直接拟合数据,可能导致次优的数据利用。为此,我们提出了 VidMan(用于机器人操作的视频扩散),一种采用受神经科学双过程理论启发的两阶段训练机制的新框架,以增强稳定性和提高数据利用效率。具体而言,在第一阶段,VidMan 在 Open X-Embodiment 数据集(OXE)上预训练,以视频去噪扩散方式预测未来视觉轨迹,使模型能够发展对环境动力学的长时域感知。在第二阶段,引入了一个灵活且有效的逐层自注意力适配器,将 VidMan 转化为高效的逆动力学模型,通过参数共享利用隐式动力学知识预测动作。我们的 VidMan 框架在 CALVIN 基准上优于最先进的基线模型 GR-1,实现了 11.7% 的相对提升,并在 OXE 小规模数据集上展示了超过 9% 的精度增益。这些结果有力地证明了世界模型能显著提高机器人动作预测的精度。代码和模型将公开。

关键词

引用

@article{arxiv.2411.09153,
  title  = {VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation},
  author = {Youpeng Wen and Junfan Lin and Yi Zhu and Jianhua Han and Hang Xu and Shen Zhao and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2411.09153},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024