中文

基于 ImageNet 的三维生成

计算机视觉与模式识别 2023-03-03 v1 人工智能 图形学

摘要

现有的从二维生成三维的生成器通常针对精心筛选的单类别数据集设计,其中所有物体具有(近似)相同的尺度、三维位置和朝向,且相机始终指向场景中心。这使得它们不适用于来自任意相机位姿渲染的、不可对齐场景的多样野外数据集。本文中,我们开发了具有通用先验的 3D 生成器(3DGP):一种对训练数据假设更为通用的三维合成框架,并展示其可扩展到极具挑战性的数据集,如 ImageNet。我们的模型基于三个新思路。首先,我们通过特殊的深度适配模块将不精确的现成深度估计器引入 3D GAN 训练以处理不精确性。然后,我们创建灵活的相机模型及其正则化策略,以在训练中学习其分布参数。最后,我们将近期从预训练分类器向 GAN 迁移知识的思想扩展到逐块训练的模型,在判别器之上采用简单的基于蒸馏的技术。它比现有方法训练更稳定,并将收敛速度加快至少 40%。我们在四个数据集上探究模型:SDIP Dogs 256x256、SDIP Elephants 256x256、LSUN Horses 256x256 和 ImageNet 256x256,并证明 3DGP 在纹理与几何质量上均优于近期 SOTA(最先进)方法。代码与可视化:https://snap-research.github.io/3dgp。

关键词

引用

@article{arxiv.2303.01416,
  title  = {3D generation on ImageNet},
  author = {Ivan Skorokhodov and Aliaksandr Siarohin and Yinghao Xu and Jian Ren and Hsin-Ying Lee and Peter Wonka and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2303.01416},
  year   = {2023}
}

备注

ICLR 2023 (Oral)