中文

回归特征:以 DINO 作为视频世界模型的基础

计算机视觉与模式识别 2025-07-28 v1

摘要

我们提出了 DINO-world,这是一个强大的通用视频世界模型,被训练用于在 DINOv2 的潜在空间中预测未来帧。通过利用预训练的图像编码器,并在大规模未筛选的视频数据集上训练未来预测器,DINO-world 学习了各种场景的时间动态,涵盖驾驶场景、室内场景以及模拟环境。我们展示了 DINO-world 在多种视频预测基准(例如分割和深度预测)上优于以往的模型,并展现出对直觉物理学的深刻理解。此外,我们展示了在观测-动作轨迹上对预测器进行微调是可行的。由此得到的动作条件世界模型可通过在潜在空间中模拟候选轨迹来用于规划。

关键词

引用

@article{arxiv.2507.19468,
  title  = {Back to the Features: DINO as a Foundation for Video World Models},
  author = {Federico Baldassarre and Marc Szafraniec and Basile Terver and Vasil Khalidov and Francisco Massa and Yann LeCun and Patrick Labatut and Maximilian Seitzer and Piotr Bojanowski},
  journal= {arXiv preprint arXiv:2507.19468},
  year   = {2025}
}