V-JEPA 2:自监督视频模型实现理解、预测与规划
人工智能
2025-06-12 v1 计算机视觉与模式识别
机器学习
机器人学
摘要
现代AI面临的一个主要挑战是通过观察来学习理解世界并学习行动。本文探索了一种自监督方法,将互联网规模的视频数据与少量交互数据(机器人轨迹)相结合,开发能够在物理世界中理解、预测和规划的模型。我们首先在包含超过100万小时互联网视频的视频和图像数据集上预训练了一个无动作的联合嵌入预测架构V-JEPA 2。V-JEPA 2在运动理解方面取得了强劲性能(Something-Something v2上77.3的top-1准确率),并在人动作预测方面取得了最先进的性能(Epic-Kitchens-100上39.7的recall-at-5),超越了之前的任务特定模型。此外,在将V-JEPA 2与大语言模型对齐后,我们在多个视频问答任务上展示了80亿参数规模的最先进性能(例如,PerceptionTest上84.0,TempCompass上76.9)。最后,我们展示了自监督学习如何应用于机器人规划任务,通过使用Droid数据集中不到62小时的无标注机器人视频对后训练一个潜在动作条件化的世界模型V-JEPA 2-AC。我们在两个不同实验室的Franka机械臂上零样本部署V-JEPA 2-AC,并通过基于图像目标的规划实现物体的抓取和放置。值得注意的是,这是在不收集这些环境中机器人数据的情况下实现的,也无需任何任务特定训练或奖励。本工作展示了如何通过自监督学习从网络规模数据和少量机器人交互数据中获得能够在物理世界中规划的世界的模型。
引用
@article{arxiv.2506.09985,
title = {V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning},
author = {Mido Assran and Adrien Bardes and David Fan and Quentin Garrido and Russell Howes and Mojtaba and Komeili and Matthew Muckley and Ammar Rizvi and Claire Roberts and Koustuv Sinha and Artem Zholus and Sergio Arnaud and Abha Gejji and Ada Martin and Francois Robert Hogan and Daniel Dugas and Piotr Bojanowski and Vasil Khalidov and Patrick Labatut and Francisco Massa and Marc Szafraniec and Kapil Krishnakumar and Yong Li and Xiaodong Ma and Sarath Chandar and Franziska Meier and Yann LeCun and Michael Rabbat and Nicolas Ballas},
journal= {arXiv preprint arXiv:2506.09985},
year = {2025}
}
备注
48 pages, 19 figures