中文

通过目标条件探索将视频模型落地为动作

机器人学 2025-03-13 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

在海量互联网视频上预训练的大型视频模型,为物体与任务的动力学和运动提供了丰富的物理知识来源。然而,视频模型并未落地于智能体的具身性中,也无法描述如何驱动世界以达到视频中描绘的视觉状态。为解决此问题,现有方法使用在具身专用数据上训练的独立视觉逆动力学模型,将图像状态映射为动作。收集此类模型的训练数据往往昂贵且困难,且该模型仅限于与可用数据相似的视觉设置。本文探讨如何通过在具身环境中的自我探索,直接将视频模型落地为连续动作——利用生成的视频状态作为探索的视觉目标。我们提出了一个框架,结合轨迹级动作生成与视频引导,使智能体能在无任何外部监督(如奖励、动作标签或分割掩码)的情况下解决复杂任务。我们在 Libero 的 8 个任务、MetaWorld 的 6 个任务、Calvin 的 4 个任务以及 iThor Visual Navigation 的 12 个任务上验证了该方法。结果表明,我们的方法在不需要任何动作标注的前提下,性能与在专家演示上训练的多个行为克隆基线持平甚至超越。

关键词

引用

@article{arxiv.2411.07223,
  title  = {Grounding Video Models to Actions through Goal Conditioned Exploration},
  author = {Yunhao Luo and Yilun Du},
  journal= {arXiv preprint arXiv:2411.07223},
  year   = {2025}
}

备注

ICLR 2025 (Spotlight). Project page: https://video-to-action.github.io/