中文

GINA-3D:学习在真实场景中生成隐式神经资产

计算机视觉与模式识别 2023-08-29 v2 人工智能 图形学 机器人学

摘要

从传感器数据建模 3D 世界用于仿真是为自主驾驶等机器人学习问题开发测试和验证环境的可扩展方式。然而,手动创建或重建类真实环境困难、昂贵且不可扩展。最近的生成模型技术通过使用丰富的 2D 图像学习 3D 资产显示出解决此类问题的良好进展——但仍存在局限,因为它们利用的是人工策划的图像数据集或手动创建的合成 3D 环境的渲染。在本文中,我们介绍 GINA-3D,一种利用来自相机和 LiDAR 传感器的真实世界驾驶数据来创建多样化车辆和行人的逼真 3D 隐式神经资产的生成模型。与现有图像数据集相比,真实世界驾驶设置因遮挡、光照变化和长尾分布带来了新挑战。GINA-3D 受近期图像生成建模进展启发,通过以学习到的三平面潜在结构将表示学习与生成建模解耦为两个阶段来应对这些挑战。为评估我们的方法,我们构建了一个大规模以对象为中心的数据集,包含来自 Waymo Open Dataset 的超过 120 万张车辆和行人图像,以及一组新的 8 万张长尾实例(如施工设备、垃圾车和缆车)图像。我们将我们的模型与现有方法比较,并证明它在生成图像和几何体的质量与多样性上均达到了最先进的性能。

关键词

引用

@article{arxiv.2304.02163,
  title  = {GINA-3D: Learning to Generate Implicit Neural Assets in the Wild},
  author = {Bokui Shen and Xinchen Yan and Charles R. Qi and Mahyar Najibi and Boyang Deng and Leonidas Guibas and Yin Zhou and Dragomir Anguelov},
  journal= {arXiv preprint arXiv:2304.02163},
  year   = {2023}
}

备注

Accepted by CVPR 2023; Our WOD-ObjectAsset can be accessed through waymo.com/open