GeoVideo: 在视频生成模型中引入几何正则化
计算机视觉与模式识别
2025-12-04 v1
摘要
近期进展使视频生成能够通过扩散变换器模型合成高质量且视觉逼真的片段。然而,大多数现有方法纯粹在2D像素空间运行,缺乏对3D结构的显式建模机制,常常导致时间不一致的几何、不合理的运动和结构伪影。在本工作中,我们通过用逐帧深度预测增强潜在扩散模型,将几何正则化损失引入视频生成。我们采用深度作为几何表示,是因为深度预测取得了重大进展及其与基于图像的潜在编码器的兼容性。具体而言,为强制执行跨时间的结构一致性,我们提出了一种多视图几何损失,在共享3D坐标系中对齐各帧内预测的深度图。我们的方法弥合了外观生成与3D结构建模之间的差距,从而改善了时空一致性、形状一致性和物理合理性。跨多个数据集的实验表明,我们的方法产生了比现有基线显著更稳定和几何一致的结果。
引用
@article{arxiv.2512.03453,
title = {GeoVideo: Introducing Geometric Regularization into Video Generation Model},
author = {Yunpeng Bai and Shaoheng Fang and Chaohui Yu and Fan Wang and Qixing Huang},
journal= {arXiv preprint arXiv:2512.03453},
year = {2025}
}
备注
Project Page: https://geovideo.github.io/GeoVideo/