FusionNet:利用多种数据表示进行三维物体分类
计算机视觉与模式识别
2016-11-29 v4
摘要
高质量的三维物体识别是许多视觉和机器人系统的重要组成部分。我们利用两种数据表示来解决物体识别问题,在普林斯顿 ModelNet 挑战赛中取得了领先结果。这两种表示分别为:1. 体积表示:将三维物体在空间上离散化为二值体素——若体素被占据则为 ,否则为 。2. 像素表示:将三维物体表示为一组投影的二维像素图像。当前 ModelNet 挑战赛的领先提交方案均在像素表示上使用卷积神经网络(CNN)。然而,我们偏离了这一趋势,并额外使用体积 CNN 来弥合上述两种表示在效率上的差距。我们结合两种表示并利用它们学习新特征,从而得到一个比单独使用任一表示都显著更好的分类器。为此,我们引入了新的体积 CNN(V-CNN)架构。
引用
@article{arxiv.1607.05695,
title = {FusionNet: 3D Object Classification Using Multiple Data Representations},
author = {Vishakh Hegde and Reza Zadeh},
journal= {arXiv preprint arXiv:1607.05695},
year = {2016}
}