基于合成数据的深度图像深度表示
计算机视觉与模式识别
2016-10-03 v1
摘要
在大规模 RGB 数据库上训练的卷积神经网络已成为近期大多数基于 RGB-D 数据进行物体分类方法的核心要素。借助彩色化技术,这些方法利用从 2D 图像中学习到的滤波器来提取 2.5D 中有意义的表示。然而,这两类图像的感知特征截然不同,前者通常以纹理为强特征,而后者主要以物体轮廓为特征。理想情况下,人们希望有两个 CNN,一个用于 RGB,一个用于深度,各自在合适的数据集上训练,能够为当前任务捕捉每个通道的感知特性。由于缺乏合适的深度数据库,这至今未能实现。本文解决了这一问题,提出选择合成生成的图像,而不是手工收集大规模 2.5D 数据库。尽管合成图像显然是真实数据的代理,但它允许以质量换取数量,使得生成几乎无限量的数据成为可能。我们表明,使用通常用于视觉数据的相同架构,从该数据集中学习到的滤波器截然不同,由此产生的深度特征 能够 更好地刻画深度图像的不同侧面,以及 与在 2D 数据集上预训练的 CNN 导出的特征互补。在两个公开数据库上的实验展示了我们方法的有效性。
引用
@article{arxiv.1609.09713,
title = {A deep representation for depth images from synthetic data},
author = {Fabio Maria Carlucci and Paolo Russo and Barbara Caputo},
journal= {arXiv preprint arXiv:1609.09713},
year = {2016}
}