中文

所见即所得:在无姿态视频上大规模学习3D生成

计算机视觉与模式识别 2025-03-24 v3

摘要

当前的3D生成方法通常依赖于规模有限的3D“金标准”数据或2D扩散先验。然而,由于缺乏可扩展的学习范式,其性能受到受限3D先验的制约。在这项工作中,我们提出了See3D,一个在大规模互联网视频上训练、用于开放世界3D生成的视觉条件多视图扩散模型。该模型旨在仅通过观察海量且快速增长的视频数据中的视觉内容来获取3D知识——所见即所得。为实现这一目标,我们首先使用所提出的数据整理流程来扩大训练数据规模,该流程自动过滤掉源视频中的多视图不一致和观测不充分的部分。由此产生了一个高质量、丰富多样的大规模多视图图像数据集,称为WebVi3D,包含来自1600万个视频片段的3.2亿帧。此外,从没有显式3D几何或相机姿态标注的视频中学习通用3D先验极具挑战性,而为网络规模视频标注姿态的成本又高得令人望而却步。为消除对姿态条件的需求,我们引入了一种创新的视觉条件——一种通过对掩码视频数据添加噪声而生成的纯2D归纳视觉信号。最后,我们通过将See3D集成到一个基于扭曲的框架中,提出了一种新颖的视觉条件3D生成方法,用于高保真3D生成。我们在单视图和稀疏视图重建基准上的定量和定性比较表明,使用经济高效的视频数据训练的See3D,其零样本和开放世界生成能力显著优于在昂贵且受限的3D数据集上训练的模型。请参阅我们的项目页面:https://vision.baai.ac.cn/see3d

关键词

引用

@article{arxiv.2412.06699,
  title  = {You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale},
  author = {Baorui Ma and Huachen Gao and Haoge Deng and Zhengxiong Luo and Tiejun Huang and Lulu Tang and Xinlong Wang},
  journal= {arXiv preprint arXiv:2412.06699},
  year   = {2025}
}

备注

Accepted by CVPR 2025, Project Page: https://vision.baai.ac.cn/see3d