通过目标条件探索将视频模型落地为动作
机器人学
2025-03-13 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
在海量互联网视频上预训练的大型视频模型,为物体与任务的动力学和运动提供了丰富的物理知识来源。然而,视频模型并未落地于智能体的具身性中,也无法描述如何驱动世界以达到视频中描绘的视觉状态。为解决此问题,现有方法使用在具身专用数据上训练的独立视觉逆动力学模型,将图像状态映射为动作。收集此类模型的训练数据往往昂贵且困难,且该模型仅限于与可用数据相似的视觉设置。本文探讨如何通过在具身环境中的自我探索,直接将视频模型落地为连续动作——利用生成的视频状态作为探索的视觉目标。我们提出了一个框架,结合轨迹级动作生成与视频引导,使智能体能在无任何外部监督(如奖励、动作标签或分割掩码)的情况下解决复杂任务。我们在 Libero 的 8 个任务、MetaWorld 的 6 个任务、Calvin 的 4 个任务以及 iThor Visual Navigation 的 12 个任务上验证了该方法。结果表明,我们的方法在不需要任何动作标注的前提下,性能与在专家演示上训练的多个行为克隆基线持平甚至超越。
引用
@article{arxiv.2411.07223,
title = {Grounding Video Models to Actions through Goal Conditioned Exploration},
author = {Yunhao Luo and Yilun Du},
journal= {arXiv preprint arXiv:2411.07223},
year = {2025}
}
备注
ICLR 2025 (Spotlight). Project page: https://video-to-action.github.io/