HRDFuse:通过协同学习整体与区域深度分布的单目360°深度估计
计算机视觉与模式识别
2023-05-23 v3
摘要
从单目360°图像进行深度估计因其对场景的整体感知而成为一个新兴问题。近来,一些方法(如OmniFusion)采用切向投影(TP)来表示360°图像,并通过逐块回归预测深度值,再将其合并以获得等距柱状投影(ERP)格式的深度图。然而,这些方法存在以下缺陷:1)合并大量图像块的过程繁琐;2)直接回归每个像素的深度值导致捕获的整体与区域上下文信息较少。本文提出一种新颖框架HRDFuse,通过协同学习ERP的整体上下文信息与TP的区域结构信息,巧妙结合卷积神经网络(CNN)与transformers的潜力。首先,我们提出空间特征对齐(SFA)模块,学习TP与ERP之间的特征相似性,以逐像素方式将TP特征聚合为完整的ERP特征图。其次,我们提出协同深度分布分类(CDDC)模块,学习捕获ERP与TP深度分布的整体-区域直方图。由此,最终深度值可预测为直方图 bin 中心的线性组合。最后,我们自适应地合并ERP与TP的深度预测以获得最终深度图。大量实验表明,与SOTA方法相比,我们的方法预测出更平滑、更准确的深度结果,并取得了明显更优的结果。
引用
@article{arxiv.2303.11616,
title = {HRDFuse: Monocular 360{\deg}Depth Estimation by Collaboratively Learning Holistic-with-Regional Depth Distributions},
author = {Hao Ai and Zidong cao and Yan-pei Cao and Ying Shan and Lin Wang},
journal= {arXiv preprint arXiv:2303.11616},
year = {2023}
}
备注
To appear at CVPR2023, 20 pages