几何即上下文:将显式3D调制到场景一致视频生成中的几何上下文
计算机视觉与模式识别
2026-02-26 v1
摘要
场景一致视频生成旨在根据相机轨迹创建探索3D场景的视频。先前的方法依赖于带有外部存储器以实现一致性的视频生成模型,或迭代的3D重建与修复,这些方法由于不正确的中间输出、不可微过程以及分离的模型而在推理过程中累积误差。为克服这些限制,我们引入了“几何即上下文”。它使用自回归相机控制视频生成模型迭代地完成以下步骤:(1) 估计当前视图用于3D重建所需的几何结构,以及 (2) 模拟并恢复由3D场景渲染的新视图图像。在此多任务框架下,我们开发了相机门控注意力模块,以增强模型有效利用相机姿态的能力。在训练阶段,利用文本上下文来确定应生成几何图像还是RGB图像。为确保模型在推理过程中能够仅生成RGB输出,几何上下文会从交错的文本-图像-几何训练序列中随机丢弃。该方法已在单向和往返轨迹的场景视频生成上进行了测试。结果表明,其在保持场景一致性和相机控制方面优于先前方法。
引用
@article{arxiv.2602.21929,
title = {Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context},
author = {JiaKui Hu and Jialun Liu and Liying Yang and Xinliang Zhang and Kaiwen Li and Shuang Zeng and Yuanwei Li and Haibin Huang and Chi Zhang and Yanye Lu},
journal= {arXiv preprint arXiv:2602.21929},
year = {2026}
}
备注
Accepted by CVPR 2026