GeoFlow:在视频生成中强制实施隐式几何一致性
计算机视觉与模式识别
2026-05-19 v1
摘要
生成几何一致的视频仍然是一个开放性挑战:在网页级数据上训练的文本到视频扩散模型仅隐式地处理几何,导致在摄像机运动下出现物体变形、纹理漂移和非刚性背景。现有解决方案要么将改善一致性作为副产品,要么仅适用于静态场景,要么完全重新对齐模型的潜在空间。我们引入了一种几何一致性奖励,直接衡量生成视频中的运动是否与连贯的场景相容。我们的关键洞察是,在物理上一致的视频中,背景运动应可由刚性摄像机诱导的光流解释,而独立运动的物体应沿运动轨迹保持外观同一性。我们使用光流、深度-姿态预测和基于特征的对应关系来实现这一点,以分离刚性和动态区域并评估它们各自的一致性。将此奖励与强化微积分相结合,将几何一致性从涌现属性转变为视频生成器的显式优化目标。该方法与模型无关,适用于包含摄像机和物体运动的多样动态场景。实验表明,与强基线相比,时间几何伪影显著减少,同时保持了感知质量。代码和模型权重已发布。
引用
@article{arxiv.2605.18365,
title = {GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation},
author = {Jan Ackermann and Shengqu Cai and Boyang Deng and Zhengfei Kuang and Songyou Peng and Gordon Wetzstein},
journal= {arXiv preprint arXiv:2605.18365},
year = {2026}
}
备注
Project Page: https://geometryflow.github.io/