中文

面向以观察者为中心的线框建模的 3D 解释器网络

计算机视觉与模式识别 2019-08-13 v2 机器学习

摘要

从单幅图像理解三维物体结构是一项重要但具挑战性的计算机视觉任务,主要归因于真实图像缺乏三维物体标注。以往研究或通过搜索最能解释二维标注的三维形状,或仅在带有真实三维信息的合成数据上训练来解决该问题。本工作中,我们提出 3D 解释器网络(3D-INN),一种端到端可训练的框架,依次估计二维关键点热图与三维物体骨架及姿态。我们的系统从带二维标注的真实图像与合成三维数据中共同学习。这主要得益于两项技术创新。首先,二维关键点热图作为中间表示连接真实与合成数据。3D-INN 在真实图像上训练以从输入图像估计二维关键点热图;随后利用从合成三维形状学到的知识由热图预测三维物体结构。如此,3D-INN 受益于合成三维物体的多样性和丰富性,又不受真实与合成图像间常因渲染不完善导致的域差异影响。其次,我们提出投影层,将估计的三维结构映射回二维。训练期间,它确保 3D-INN 预测出的三维结构其投影与真实图像的二维标注一致。实验表明,所提系统在二维关键点估计与三维结构恢复上均表现良好。我们还展示了恢复的三维信息具有广泛的视觉应用,如图像检索。

关键词

引用

@article{arxiv.1804.00782,
  title  = {3D Interpreter Networks for Viewer-Centered Wireframe Modeling},
  author = {Jiajun Wu and Tianfan Xue and Joseph J. Lim and Yuandong Tian and Joshua B. Tenenbaum and Antonio Torralba and William T. Freeman},
  journal= {arXiv preprint arXiv:1804.00782},
  year   = {2019}
}

备注

Journal preprint of arXiv:1604.08685 (IJCV, 2018). The first two authors contributed equally to this work. Project page: http://3dinterpreter.csail.mit.edu