基于 ImageNet 自然图像的几何感知 3D 生成
计算机视觉与模式识别
2024-02-05 v2
摘要
生成精确的 3D 模型是一个具有挑战性的问题,传统上需要使用监督学习从 3D 数据集中进行显式学习。尽管最近的进展展示了从 2D 图像学习 3D 模型的潜力,但这些方法通常依赖于结构良好的数据集,其中包含每个实例的多视图图像或相机位姿信息。此外,这些数据集通常具有干净的背景和简单的形状,使得它们获取成本高昂且难以泛化,从而限制了这些方法的适用性。为了克服这些限制,我们提出了一种在没有相机位姿信息的情况下,从多样且非结构化的 ImageNet 数据集中重建 3D 几何的方法。我们使用高效的三平面表示从 2D 图像中学习 3D 模型,并基于 StyleGAN2 修改生成器主干的架构以适应高度多样化的数据集。为了防止模式崩溃并提高在多样化数据上的训练稳定性,我们提出使用多视图判别。训练后的生成器可以产生类条件的 3D 模型以及来自任意视点的渲染图像。类条件生成结果显著优于当前 SOTA 方法。此外,使用 PTI,我们可以从单视图图像中高效地重建整个 3D 几何。
引用
@article{arxiv.2402.00225,
title = {Geometry aware 3D generation from in-the-wild images in ImageNet},
author = {Qijia Shen and Guangrun Wang},
journal= {arXiv preprint arXiv:2402.00225},
year = {2024}
}