中文

从单张输入图像对不同类别物体进行端到端三维形状逆渲染

计算机视觉与模式识别 2017-11-17 v1 人工智能

摘要

本文提出一种半监督深度框架,用于从单张2D输入图像进行3D形状逆渲染的问题。所提框架的主体结构由无监督预训练组件构成,显著减少训练整体框架对标注数据的需求。使用标注数据的优势在于无需对图像形成过程作预定义假设即可获得准确结果。所提网络使用三个主要组件:将2D输入图像映射到表示空间的编码器、将表示解码为3D结构的3D解码器,以及用于映射2D到3D表示的映射组件。唯一需要标签训练的部分是参数不多的映射部分。网络中其他组件可分别仅用2D图像或3D数据无监督预训练。解码器组件中重建3D形状的方式受基于模型的3D重建方法启发,将低维表示映射到3D形状空间,其优势在于从训练数据自身提取形状空间基向量,而不像预定义模型限于少量示例。因此,所提框架直接处理点云表示的坐标值,从而在输出中得到稠密3D形状。在物体与人脸的多个基准数据集上并与近期同类方法比较的实验结果显示了所提网络从单张2D图像恢复更多细节的能力。

关键词

引用

@article{arxiv.1711.05858,
  title  = {End-to-end 3D shape inverse rendering of different classes of objects from a single input image},
  author = {Shima Kamyab and S. Zohreh Azimifar},
  journal= {arXiv preprint arXiv:1711.05858},
  year   = {2017}
}

备注

16 pages, 12 figures, 2 tables