中文

借助VJEPA-2奖励信号提升视频生成的物理学水平

计算机视觉与模式识别 2025-10-28 v1 图形学

摘要

本文是一篇简短的技术报告,描述了PhysicsIQ挑战在2025年ICCV Perception Test Workshop中获奖作品。当前最先进的视频生成模型在物理理解方面严重受限,常产生不符合物理常识的视频。Physics IQ基准已表明,视觉逼真并不等于物理理解。然而,直观的物理理解已显示可从SSL在自然视频上的预训练中获得。在本报告中,我们调查了是否可以利用SSL-based video world models来提高视频生成模型的物理合理性。具体而言,我们在最先进的视频生成模型MAGI-1之上构建, 并将最近引入的Video Joint Embedding Predictive Architecture 2(VJEPA-2)作为奖励信号,用于指导生成过程。我们表明,通过利用VJEPA-2作为奖励信号,可将最先进的视频生成模型的物理合理性提升约6%。

关键词

引用

@article{arxiv.2510.21840,
  title  = {Improving the Physics of Video Generation with VJEPA-2 Reward Signal},
  author = {Jianhao Yuan and Xiaofeng Zhang and Felix Friedrich and Nicolas Beltran-Velez and Melissa Hall and Reyhane Askari-Hemmat and Xiaochuang Han and Nicolas Ballas and Michal Drozdzal and Adriana Romero-Soriano},
  journal= {arXiv preprint arXiv:2510.21840},
  year   = {2025}
}

备注

2 pages