中文

VGGRPO:基于4D潜在奖励实现世界一致性视频生成

计算机视觉与模式识别 2026-03-30 v1

摘要

大规模视频扩散模型实现了令人印象深刻的视觉质量,但往往无法保持几何一致性。先前的方法要么通过为生成器添加额外模块来改善一致性,要么应用几何感知对齐。然而,架构修改可能损害互联网规模预训练模型的泛化能力,而现有的对齐方法仅限于静态场景且依赖RGB空间奖励,需要重复的VAE解码,带来大量计算开销,且无法泛化到高度动态的真实场景。为在保持预训练能力的同时改善几何一致性,我们提出了VGGRPO(Visual Geometry GRPO),一种用于几何感知视频后训练的潜在几何引导框架。VGGRPO引入了一个潜在几何模型(Latent Geometry Model, LGM),将视频扩散潜在表示与几何基础模型连接,使场景几何可直接从潜在空间解码。通过从具有4D重建能力的几何模型构建LGM,VGGRPO自然地扩展到动态场景,克服了先前方法的静态场景限制。在此基础上,我们在潜在空间中执行组相对策略优化(Group Relative Policy Optimization),采用两个互补奖励:惩罚抖动轨迹的相机运动平滑奖励,以及强制跨视图几何一致性的几何重投影一致性奖励。在静态和动态基准上的实验表明,VGGRPO在消除昂贵的VAE解码的同时,改善了相机稳定性、几何一致性和整体质量,使潜在空间几何引导强化学习成为实现世界一致性视频生成的高效灵活方法。

关键词

引用

@article{arxiv.2603.26599,
  title  = {VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward},
  author = {Zhaochong An and Orest Kupyn and Théo Uscidda and Andrea Colaco and Karan Ahuja and Serge Belongie and Mar Gonzalez-Franco and Marta Tintore Gazulla},
  journal= {arXiv preprint arXiv:2603.26599},
  year   = {2026}
}

备注

Project Page: https://zhaochongan.github.io/projects/VGGRPO