基于隐式世界模型的视频生成模型推理时物理对齐
计算机视觉与模式识别
2026-03-02 v2
摘要
最先进的视频生成模型虽产生鼎舞视觉内容,却常违背基本物理原理,限制了其实用性。虽有些人将此缺陷归因于预训练时对物理理解不足,但我们发现物理可信度短板也源于次优的推理策略。因此,我们引入WMReward,将提升视频生成物理可信度视为推理时对齐问题。在具体做法中,我们利用隐式世界模型(本研究中为VJEPA-2)的强物理先验作为奖励,搜索并引导多个候选去噪轨迹,以实现推理计算的规模化,从而提升生成性能。经验上,我们的方法在图像条件、多帧条件和文本条件生成设置下显著提升物理可信度,人类偏好研究亦予以验证。值得注意的是,在ICCV 2025 Perception Test PhysicsIQ Challenge中,我们实现了62.64%的最终得分,夺得第一名,超越前所未有的SOTA高出7.42%。我们的工作证明了利用隐式世界模型提升视频生成物理可信度的可行性,超越了此具体实例或参数化方案。
引用
@article{arxiv.2601.10553,
title = {Inference-time Physics Alignment of Video Generative Models with Latent World Models},
author = {Jianhao Yuan and Xiaofeng Zhang and Felix Friedrich and Nicolas Beltran-Velez and Melissa Hall and Reyhane Askari-Hemmat and Xiaochuang Han and Nicolas Ballas and Michal Drozdzal and Adriana Romero-Soriano},
journal= {arXiv preprint arXiv:2601.10553},
year = {2026}
}
备注
22 pages, 10 figures