基于注意力的上下文聚合网络用于单目深度估计
计算机视觉与模式识别
2019-01-30 v1
摘要
深度估计是一项传统的计算机视觉任务,在理解三维场景几何中起着关键作用。近来,基于深度卷积神经网络的方法在单目深度估计领域取得了令人瞩目的结果。具体而言,结合由基于空洞卷积的模块(空洞空间金字塔池化,ASPP)提取的多尺度特征的框架在密集标注任务中获得了显著改进。然而,离散化且预定义的空洞率无法捕获不同场景中变化的连续上下文信息,并容易在深度估计中引入网格伪影。本文中,我们提出一种基于注意力的上下文聚合网络(ACAN)来解决这些困难。基于自注意力模型,ACAN 自适应地学习像素间任务特定的相似性以建模上下文信息。首先,我们将单目深度估计重新表述为密集标注的多类分类问题。随后我们提出一种软序数推断将预测概率转换为连续深度值,可降低离散化误差(RMSE 约降低 1%)。其次,所提 ACAN 聚合图像级和像素级上下文信息用于深度估计,前者表达整幅图像的统计特征,后者为每个像素提取长程空间依赖。第三,为进一步减小 RGB 图像与深度图之间的不一致性,我们构造了一种注意力损失以最小化两者的信息熵。我们在公开单目深度估计基准数据集(包括 NYU Depth V2、KITTI)上进行了评估。实验证明了我们所提 ACAN 的优越性,并取得了与当前最优方法相当的结果。
引用
@article{arxiv.1901.10137,
title = {Attention-based Context Aggregation Network for Monocular Depth Estimation},
author = {Yuru Chen and Haitao Zhao and Zhengwei Hu},
journal= {arXiv preprint arXiv:1901.10137},
year = {2019}
}
备注
12 pages, 10 figures