HiMODE:一种混合单目全向深度估计模型
计算机视觉与模式识别
2022-04-12 v1
摘要
单目全向深度估计因其在感知 360{\deg} 周边环境中的广泛应用而受到相当的研究关注。该领域的现有方法在恢复小物体细节以及地面真值深度图获取期间数据丢失方面存在局限。本文提出一种新颖的单目全向深度估计模型,即 HiMODE,其基于混合 CNN+Transformer(编码器-解码器)架构,各模块经高效设计以在不降低性能的前提下缓解畸变与计算成本。首先,我们设计了基于 HNet 块的特征金字塔网络以提取边缘附近的高分辨率特征。受益于 Transformer 编码器与解码器中分别存在的自注意力与交叉注意力层以及空间/时间块,性能得到进一步提升。此外,采用空间残差块以减少参数量。通过将输入图像在每个骨干块提取的深度特征,连同由 transformer 编码器-解码器预测的粗深度图,共同经由上下文调整层,我们的模型可生成比地面真值具有更佳视觉质量的深度图。全面的消融研究证明了各独立模块的重要性。在 Stanford3D、Matterport3D 和 SunCG 三个数据集上的大量实验表明,HiMODE 在 360{\deg} 单目深度估计上可达到 SOTA 性能。
引用
@article{arxiv.2204.05007,
title = {HiMODE: A Hybrid Monocular Omnidirectional Depth Estimation Model},
author = {Masum Shah Junayed and Arezoo Sadeghzadeh and Md Baharul Islam and Lai-Kuan Wong and Tarkan Aydin},
journal= {arXiv preprint arXiv:2204.05007},
year = {2022}
}
备注
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2022)