利用单目图像深度提升目标检测与语义分割
计算机视觉与模式识别
2016-11-17 v1
摘要
已有研究表明,用实测深度增强RGB数据可以提升计算机视觉中包括目标检测和语义分割在内的一系列任务的性能。尽管像微软Kinect这样的深度传感器使得此类深度信息的获取变得容易,但视觉任务中使用的绝大多数图像并不包含深度信息。在本文中,我们证明用估计深度增强RGB图像同样可以提高目标检测和语义分割的精度。具体来说,我们首先利用近期单目图像深度估计的成功,学习一个深度估计模型。然后,我们从估计深度中学习深度特征,并将其与RGB特征结合用于目标检测和语义分割。此外,我们提出了一种RGB-D语义分割方法,该方法应用了多任务训练方案:语义标签预测和深度值回归。我们在多个数据集上测试了我们的方法,并证明融合来自估计深度的信息能显著提升目标检测和语义分割的性能。
引用
@article{arxiv.1610.01706,
title = {Exploiting Depth from Single Monocular Images for Object Detection and Semantic Segmentation},
author = {Yuanzhouhan Cao and Chunhua Shen and Heng Tao Shen},
journal= {arXiv preprint arXiv:1610.01706},
year = {2016}
}
备注
14 pages. Accepted to IEEE T. Image Processing