用于三维形状识别的多视图卷积神经网络
计算机视觉与模式识别
2015-09-29 v3 图形学
摘要
计算机视觉中一个长期存在的问题是关于用于识别的三维形状表示:三维形状应当用作用于其原生三维格式(如体素网格或多边形网格)的描述子来表示,还是可以用基于视图的描述子来有效表示?我们在从三维形状在二维图像上渲染视图的集合中学习识别形状的背景下探讨这一问题。我们首先提出一种标准 CNN 架构,训练其相互独立地识别形状的渲染视图,并表明即使从单一视图也能以远高于最先进三维形状描述子的准确率识别三维形状。当提供形状的多视图时,识别率进一步提高。此外,我们提出一种新颖的 CNN 架构,将三维形状多视图的信息组合为单一且紧凑的形状描述子,从而提供更好的识别性能。同一架构可应用于准确识别人手绘的形状草图。我们得出结论,二维视图的集合对三维形状识别具有高度信息量,并且适用于新兴的 CNN 架构及其衍生模型。
引用
@article{arxiv.1505.00880,
title = {Multi-view Convolutional Neural Networks for 3D Shape Recognition},
author = {Hang Su and Subhransu Maji and Evangelos Kalogerakis and Erik Learned-Miller},
journal= {arXiv preprint arXiv:1505.00880},
year = {2015}
}
备注
v1: Initial version. v2: An updated ModelNet40 training/test split is used; results with low-rank Mahalanobis metric learning are added. v3 (ICCV 2015): A second camera setup without the upright orientation assumption is added; some accuracy and mAP numbers are changed slightly because a small issue in mesh rendering related to specularities is fixed