面向单目深度估计的结构感知残差金字塔网络
计算机视觉与模式识别
2019-07-16 v1
摘要
单目深度估计是场景理解的一项基本任务。复杂场景中物体与物质的底层结构对于恢复准确且视觉宜人的深度图至关重要。全局结构传达场景布局,而局部结构反映形状细节。近来基于卷积神经网络(CNNs)的方法显著提升了深度估计性能。然而,它们中极少考虑复杂场景中的多尺度结构。本文中,我们提出结构感知残差金字塔网络(SARPN)以利用多尺度结构进行精确深度预测。我们提出残差金字塔解码器(RPD),其在上层表达全局场景结构以表示布局,在下层表达局部结构以呈现形状细节。在每一层,我们提出残差细化模块(RRM),预测残差图以在上一层预测的较粗结构上逐步添加更细的结构。为充分利用多尺度图像特征,引入了自适应稠密特征融合(ADFF)模块,其自适应融合来自所有尺度的有效特征以推断各尺度的结构。在具挑战性的 NYU-Depth v2 数据集上的实验结果表明,我们提出的方法在定性与定量评估中均达到最先进性能。代码见 https://github.com/Xt-Chen/SARPN。
引用
@article{arxiv.1907.06023,
title = {Structure-Aware Residual Pyramid Network for Monocular Depth Estimation},
author = {Xiaotian Chen and Xuejin Chen and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:1907.06023},
year = {2019}
}
备注
7pages, 7figures, Accepted by the 28th International Joint Conference on Artificial Intelligence (IJCAI-2019)