基于自注意力与离散视差体积的自监督单目训练深度估计
计算机视觉与模式识别
2020-04-01 v1 机器学习
摘要
单目深度估计已成为计算机视觉中研究最多的应用之一,其中最精确的方法基于全监督学习模型。然而,获取准确且大规模的真实数据集以建模这些全监督方法,是该领域进一步发展的主要挑战。用单目视频训练的自监督方法因训练数据广泛可得,是构成缓解上述挑战最有前景的途径之一。因此,它们已被深入研究,所探索的主要思路包括不同类型的模型架构、损失函数以及用于处理非刚性运动的遮挡掩码。本文中,我们提出两个新思路以改进自监督单目训练深度估计:1)自注意力,以及2)离散视差预测。与通常的局部卷积操作相比,自注意力能够探索更一般的上下文信息,从而可在图像的非连续区域推断相似的视差值。全监督方法已表明,除能估计深度不确定性外,离散视差预测比更常见的连续视差预测提供更鲁棒且更锐利的深度估计。我们展示,用这两个思路扩展SOTA自监督单目训练深度估计器Monodepth2,可设计出在KITTI 2015与Make3D上取得该领域最佳结果的模型,缩小了与自监督立体训练及全监督方法之间的差距。
引用
@article{arxiv.2003.13951,
title = {Self-supervised Monocular Trained Depth Estimation using Self-attention and Discrete Disparity Volume},
author = {Adrian Johnston and Gustavo Carneiro},
journal= {arXiv preprint arXiv:2003.13951},
year = {2020}
}