几何与语义相结合的单目深度半监督估计
计算机视觉与模式识别
2018-10-29 v2
摘要
从单幅图像估计深度是计算机视觉中非常令人振奋的挑战。虽然其他基于图像的深度感知技术利用不同视角间的几何关系(如立体视觉或运动恢复结构),但单幅图像内这些线索的缺失使得单目深度估计任务成为不适定问题。在推断时,用于单目深度估计的最先进编码器-解码器架构依赖于训练时学到的有效特征表示。对于这些模型的无监督训练,几何已被通过立体装置或运动相机获取的视图所计算出的合适图像扭曲损失有效利用。在本文中,我们向前迈进一步,表明从图像中学习语义信息亦能有效改进单目深度估计。具体而言,通过利用带有语义标注的图像以及由几何通过图像扭曲损失获得的无监督信号,我们提出一种旨在联合语义分割与深度估计的深度学习方法。我们的整体学习框架是半监督的,因为我们仅在语义域内部署真值数据。在训练时,我们的网络为两项任务学习共同的特征表示,并提出了一种新颖的跨任务损失函数。实验结果表明,联合处理深度预测与语义分割能够提升深度估计精度。特别是在KITTI数据集上,我们的网络优于单目深度估计的最先进方法。
引用
@article{arxiv.1810.04093,
title = {Geometry meets semantics for semi-supervised monocular depth estimation},
author = {Pierluigi Zama Ramirez and Matteo Poggi and Fabio Tosi and Stefano Mattoccia and Luigi Di Stefano},
journal= {arXiv preprint arXiv:1810.04093},
year = {2018}
}
备注
16 pages, Accepted to ACCV 2018