LiftImage3D:利用视频生成先验将任意单张图像提升为 3D 高斯
计算机视觉与模式识别
2024-12-13 v1 图形学
摘要
单图像 3D 重建是计算机视觉中的基础挑战,由于固有的几何歧义和有限视点信息。最近在潜在视频扩散模型(LVDMs)中的进展为从大规模视频数据中学习的 3D 先验提供了可行方案。然而,这些先验的有效利用面临三个关键挑战:(1)大规模相机运动下的质量下降,(2)实现精确相机控制的困难,(3)扩散过程固有的几何畸变损坏 3D 一致性。我们通过提出 LiftImage3D 框架来解决这些挑战,有效释放 LVDMs 的生成先验并确保 3D 一致性。具体而言,我们设计了关节轨迹策略以生成视频帧,将大规模相机运动的视频序列分解为可控的小运动序列。随后我们使用鲁棒的神经匹配模型(即 MASt3R)来校准生成帧的相机姿态并生成对应的点云。最后,我们提出了一种能学习帧之间独立畸变并输出无畸变标准高斯的畸变感知 3D 高斯溅射表示。大量实验表明,LiftImage3D 在 LLFF、DL3DV 和 Tanks and Temples 等两个具有挑战性的数据集上实现了最先进的性能,并能良好地泛化到来自各种野生图像,从卡通插画到复杂的真实场景。
引用
@article{arxiv.2412.09597,
title = {LiftImage3D: Lifting Any Single Image to 3D Gaussians with Video Generation Priors},
author = {Yabo Chen and Chen Yang and Jiemin Fang and Xiaopeng Zhang and Lingxi Xie and Wei Shen and Wenrui Dai and Hongkai Xiong and Qi Tian},
journal= {arXiv preprint arXiv:2412.09597},
year = {2024}
}
备注
Project page: https://liftimage3d.github.io/