中文

VQ3D:在ImageNet上学习三维感知生成模型

计算机视觉与模式识别 2023-02-15 v1

摘要

近期工作已表明,可从对应于单一对象类别(如人脸、动物脸或汽车)的小数据集上的2D图像集合训练3D内容生成模型。然而,这些模型在更大、更复杂的数据集上表现不佳。为对如ImageNet般多样且不受约束的图像集合建模,我们提出VQ3D,其在两阶段向量量化自编码器中引入基于NeRF的解码器。我们的阶段1可重建输入图像并能够改变围绕该图像的相机位置,阶段2可生成新的3D场景。VQ3D能够从含120万张训练图像的1000类ImageNet数据集中生成和重建3D感知图像。我们取得了16.8的ImageNet生成FID分数,而次优基线方法为69.8。

关键词

引用

@article{arxiv.2302.06833,
  title  = {VQ3D: Learning a 3D-Aware Generative Model on ImageNet},
  author = {Kyle Sargent and Jing Yu Koh and Han Zhang and Huiwen Chang and Charles Herrmann and Pratul Srinivasan and Jiajun Wu and Deqing Sun},
  journal= {arXiv preprint arXiv:2302.06833},
  year   = {2023}
}

备注

15 pages. For visual results, please visit the project webpage at http://kylesargent.github.io/vq3d