中文

FusionNet:利用多种数据表示进行三维物体分类

计算机视觉与模式识别 2016-11-29 v4

摘要

高质量的三维物体识别是许多视觉和机器人系统的重要组成部分。我们利用两种数据表示来解决物体识别问题,在普林斯顿 ModelNet 挑战赛中取得了领先结果。这两种表示分别为:1. 体积表示:将三维物体在空间上离散化为二值体素——若体素被占据则为 11,否则为 00。2. 像素表示:将三维物体表示为一组投影的二维像素图像。当前 ModelNet 挑战赛的领先提交方案均在像素表示上使用卷积神经网络(CNN)。然而,我们偏离了这一趋势,并额外使用体积 CNN 来弥合上述两种表示在效率上的差距。我们结合两种表示并利用它们学习新特征,从而得到一个比单独使用任一表示都显著更好的分类器。为此,我们引入了新的体积 CNN(V-CNN)架构。

关键词

引用

@article{arxiv.1607.05695,
  title  = {FusionNet: 3D Object Classification Using Multiple Data Representations},
  author = {Vishakh Hegde and Reza Zadeh},
  journal= {arXiv preprint arXiv:1607.05695},
  year   = {2016}
}