单图像三维解释网络
计算机视觉与模式识别
2016-10-06 v2 机器学习
摘要
从单幅图像理解三维物体结构是计算机视觉中重要但困难的任务,主要由于真实图像中缺乏三维物体标注。先前工作或通过给定 2D 关键点位置求解优化任务,或在带有真值三维信息的合成数据上训练来解决此问题。本工作中,我们提出 3D INterpreter Network (3D-INN),一种端到端框架,依次估计 2D 关键点热图与三维物体结构,并在真实 2D 标注图像与合成三维数据上训练。这主要得益于两项技术创新。首先,我们提出投影层(Projection Layer),将估计的三维结构投影到 2D 空间,从而 3D-INN 可被训练以预测由真实图像上 2D 标注监督的三维结构参数。其次,关键点的热图作为连接真实与合成数据的中间表示,使 3D-INN 能从合成三维物体的多样性和丰富性中获益,而不受不完美渲染导致的真实与合成图像统计差异的影响。该网络在 2D 关键点估计与三维结构恢复上均达到最先进性能。我们还展示了恢复的三维信息可用于其他视觉应用,如三维渲染与图像检索。
引用
@article{arxiv.1604.08685,
title = {Single Image 3D Interpreter Network},
author = {Jiajun Wu and Tianfan Xue and Joseph J. Lim and Yuandong Tian and Joshua B. Tenenbaum and Antonio Torralba and William T. Freeman},
journal= {arXiv preprint arXiv:1604.08685},
year = {2016}
}
备注
ECCV 2016 (oral). The first two authors contributed equally to this work