用于单目深度预测的边界诱导与场景聚合网络
计算机视觉与模式识别
2021-04-14 v2 人工智能
摘要
单目深度预测是场景理解中的一项重要任务。其旨在预测单张 RGB 图像的稠密深度。随着深度学习的发展,该任务的性能取得了很大提升。然而,两个问题仍未解决:(1)深层特征编码了场景中错误的最远区域,导致预测深度的 3D 结构失真;(2)低级特征利用不足,使得在具有突变深度变化的边缘附近估计深度更加困难。为解决这两个问题,我们提出了边界诱导与场景聚合网络(BS-Net)。在该网络中,首先设计深度相关性编码器(DCE)以获取图像中区域间的上下文相关性,并通过考虑这些相关性感知最远区域。同时,设计自底向上边界融合(BUBF)模块以提取指示深度变化的精确边界。最后,设计条纹细化模块(SRM)以根据边界线索细化稠密深度,从而提升预测深度的边界精度。在 NYUD v2 数据集和 iBims-1 数据集上的若干实验结果证明了所提方法的领先性能。并使用 SUN-RGBD 数据集评估我们方法的泛化性。代码见 https://github.com/XuefengBUPT/BS-Net。
引用
@article{arxiv.2102.13258,
title = {Boundary-induced and scene-aggregated network for monocular depth prediction},
author = {Feng Xue and Junfeng Cao and Yu Zhou and Fei Sheng and Yankai Wang and Anlong Ming},
journal= {arXiv preprint arXiv:2102.13258},
year = {2021}
}
备注
Accepted by Pattern Recognition 2021