通过梯度场与对比损失学习几何表示以实现数据高效深度估计
计算机视觉与模式识别
2021-03-18 v2 机器学习
机器人学
摘要
从单张 RGB 图像估计深度图已被广泛研究用于定位、建图与三维目标检测。近期关于单视图深度估计的研究大多基于深度卷积神经网络(ConvNets),其需要大量带有密集标注标签的训练数据。深度标注任务既昂贵又低效,因此不可避免地要利用极易收集的 RGB 图像来提升无深度标签下 ConvNets 的性能。然而,大多数自监督学习算法侧重于捕捉图像的语义信息以改进分类或目标检测中的性能,而非深度估计。在本文中,我们表明现有自监督方法在深度估计上表现不佳,并提出一种基于梯度的自监督学习算法,结合动量对比损失,以帮助 ConvNets 从无标注图像中提取几何信息。结果,网络可用相对较少量的标注数据准确估计深度图。为表明我们的方法独立于模型结构,我们用两种不同的单目深度估计算法评估了我们的方法。在 NYU Depth v2 数据集上,我们的方法优于先前 state-of-the-art 的自监督学习算法,并且相比随机初始化显示出标注数据三倍的高效性。
引用
@article{arxiv.2011.03207,
title = {Learning a Geometric Representation for Data-Efficient Depth Estimation via Gradient Field and Contrastive Loss},
author = {Dongseok Shim and H. Jin Kim},
journal= {arXiv preprint arXiv:2011.03207},
year = {2021}
}
备注
IEEE ICRA 2021 accepted