(DE)^2 CO: 深度深度图着色
计算机视觉与模式识别
2018-02-22 v3
摘要
对物体进行分类的能力对机器人至关重要。除了由 RGB 通道捕获的视觉外观知识外,机器人还极大地需要深度信息来理解世界。尽管在 RGB 机器人图像上使用深度网络已经受益于在 ImageNet 等数据库上获得的大量成果,但在深度图像上使用卷积网络需要将其映射到三个通道。这种迁移学习过程使得预训练深度架构能够对其进行处理。当前的映射方法基于对预处理步骤的启发式假设以及关于应最大程度保留哪些深度特性的假设,这往往导致繁琐的数据可视化,并在泛化性和识别结果方面表现次优。在此,我们采用另一种途径,尝试利用参考 RGB-D 数据库作为训练数据,为任何给定的预训练架构学习最优的着色映射。我们提出了一种利用残差范式的深度网络架构,该架构学习如何将深度数据映射为三通道图像。对采用该方法获得的图像进行的定性分析清楚地表明,学习最优映射比当前人工设计的方法能更好地保留丰富的深度信息。在 Washington、JHUIT-50 和 BigBIRD 公共基准数据库上使用 CaffeNet、VGG16、GoogleNet 和 ResNet50 进行的实验清楚地展示了我们方法的强大能力,与仅使用深度通道的现有技术竞争者相比,性能提升了高达 16%,在处理 RGB-D 数据时达到了顶尖性能。
引用
@article{arxiv.1703.10881,
title = {(DE)^2 CO: Deep Depth Colorization},
author = {F. M. Carlucci and P. Russo and B. Caputo},
journal= {arXiv preprint arXiv:1703.10881},
year = {2018}
}