中文

LaVR:基于大型4D重建模型的场景潜在条件生成视频轨迹重渲染

计算机视觉与模式识别 2026-04-03 v2 机器学习

摘要

给定单目视频,视频重渲染的目标是生成场景的不同视图。现有方法面临两个挑战:几何无条件模型缺乏空间感知,导致在视点变化时出现漂移和变形;而几何条件模型依赖于估计的深度和显式重建,容易受到深度不准确和标定误差的影响。我们提出的方法是利用大型4D重建模型潜在空间中嵌入的隐式几何知识来条件化视频生成过程。这些潜在表示在没有显式重建的情况下捕获场景结构的连续空间表示。因此,它们提供了一种灵活的表示,允许预训练的扩散先验更有效地正则化错误。通过同时条件化这些潜在表示和源相机位姿,我们展示了该模型在视频重渲染任务上实现了最先进的效果。项目网页为 https://lavr-4d-scene-rerender.github.io/。

关键词

引用

@article{arxiv.2601.14674,
  title  = {LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models},
  author = {Mingyang Xie and Numair Khan and Tianfu Wang and Naina Dhingra and Seonghyeon Nam and Haitao Yang and Zhuo Hui and Christopher Metzler and Andrea Vedaldi and Hamed Pirsiavash and Lei Luo},
  journal= {arXiv preprint arXiv:2601.14674},
  year   = {2026}
}