KFC-W:从未对准的互联网照片生成 3D 一致视频
计算机视觉与模式识别
2026-05-08 v2
摘要
我们解决从未对准的互联网照片生成视频的问题。少量输入图像作为关键帧,模型在它们之间进行插值,以模拟相机之间运动的路径。对于随机图像,模型捕捉底层几何、识别场景身份并将帧关系理解为相机位置和姿态的能力,反映了对 3D 结构和场景布局的基本理解。然而,现有的视频模型如 Luma Dream Machine 在此任务上表现不佳。我们设计了一种自监督方法,利用视频的一致性和多视角互联网照片的多样性进行训练,构建一个可扩展的、具 3D awareness 的视频模型,无需任何 3D 标注(如相机参数)。我们验证了该方法在几何和外观一致性方面优于所有基线方法。我们还展示模型受益于能够实现相机控制的应用,如 3D 高斯细分。我们的结果表明,可以仅使用 2D 数据(如视频和多视角互联网照片)来扩大场景级 3D 学习。
引用
@article{arxiv.2411.13549,
title = {KFC-W: Generating 3D-Consistent Videos from Unposed Internet Photos},
author = {Gene Chou and Kai Zhang and Sai Bi and Hao Tan and Zexiang Xu and Fujun Luan and Bharath Hariharan and Noah Snavely},
journal= {arXiv preprint arXiv:2411.13549},
year = {2026}
}
备注
project page: https://genechou.com/kfcw/