中文

Lift3D:将任意 2D 视觉模型零样本提升至 3D

计算机视觉与模式识别 2024-03-29 v1

摘要

近年来,在大规模 2D 图像数据集的推动下,用于语义分割、风格迁移或场景编辑等众多任务的 2D 视觉模型呈现爆发式增长。与此同时,人们对来自多视图图像的 3D 场景表示(如神经辐射场)重新产生了兴趣。然而,与 2D 图像数据集相比,3D 或多视图数据的可用性仍然非常有限,这使得将 2D 视觉模型扩展到 3D 数据极具吸引力但也极具挑战性。事实上,将诸如场景编辑之类的单个 2D 视觉算子扩展到 3D 通常需要一种专用于该任务的极具创造性的方法,并且通常需要逐场景优化。在本文中,我们提出这样一个问题:任何 2D 视觉模型是否都可以被提升以做出 3D 一致的预测。我们对这个问题给出了肯定的回答;我们新的 Lift3D 方法训练在由少数视觉模型(即 DINO 和 CLIP)生成的特征空间上预测未见视图,但随后能泛化到新颖的视觉算子和任务,例如风格迁移、超分辨率、开放词汇分割和图像着色;对于其中一些任务,以前没有可比较的 3D 方法。在许多情况下,我们甚至优于专门针对该任务的最先进方法。此外,Lift3D 是一种零样本方法,即它不需要特定任务的训练,也不需要特定场景的优化。

关键词

引用

@article{arxiv.2403.18922,
  title  = {Lift3D: Zero-Shot Lifting of Any 2D Vision Model to 3D},
  author = {Mukund Varma T and Peihao Wang and Zhiwen Fan and Zhangyang Wang and Hao Su and Ravi Ramamoorthi},
  journal= {arXiv preprint arXiv:2403.18922},
  year   = {2024}
}

备注

Computer Vision and Pattern Recognition Conference (CVPR), 2024