补全还是估计,这是个问题:一种用于深度补全与单目深度估计的多任务方法
计算机视觉与模式识别
2019-08-16 v1 机器学习
摘要
鲁棒的三维场景理解如今是一个不断发展的研究领域,在自动驾驶和机器人导航等许多现实应用中高度相关。本文提出一种基于多任务学习的模型,能够执行两项任务:稀疏深度补全(即给定稀疏深度图像作为输入,生成完整的稠密场景深度)与单目深度估计(即从单张 RGB 图像预测场景深度),通过两个子网络使用从公开可用的合成与真实图像语料库中随机采样的数据端到端联合训练。第一个子网络通过从场景中学习低级特征生成稀疏深度图像,第二个子网络预测整个场景的完整稠密深度图像,从而实现对场景更好的几何与上下文理解,并因此带来更优的方法性能。整个模型可用于从单张 RGB 图像推断完整场景深度,或者第二个网络可单独使用,在给定稀疏深度输入时执行深度补全。利用对抗训练、鲁棒的目标函数、依赖跳跃连接的深度架构以及合成与真实训练数据的混合,我们的方法能够生成高质量的场景深度。大量实验评估证明了我们的方法在两个问题领域相较于当代最先进技术的有效性。
引用
@article{arxiv.1908.05540,
title = {To complete or to estimate, that is the question: A Multi-Task Approach to Depth Completion and Monocular Depth Estimation},
author = {Amir Atapour-Abarghouei and Toby P. Breckon},
journal= {arXiv preprint arXiv:1908.05540},
year = {2019}
}
备注
International Conference on 3D Vision (3DV) 2019