中文

Elite360D:基于语义与距离感知的双投影融合实现高效360度深度估计

计算机视觉与模式识别 2024-05-28 v2

摘要

360度深度估计因其全向视场(FoV)在三维重建中近期受到极大关注。现有方法主要集中于基于几何重投影的跨投影融合:它们将等距柱状投影(ERP)的360度图像与另一种投影类型(如立方体贴图投影)融合,以ERP格式估计深度。然而,这些方法存在以下问题:1)局部感受野有限,难以捕获大视场场景;2)复杂的跨投影融合模块设计导致计算成本过高。本文提出Elite360D,一个新颖的框架,其输入为ERP图像和无失真且空间连续的二十面体投影(ICOSAP)点集。Elite360D在从局部与全局视角学习表征方面具有优势。通过一个灵活的ERP图像编码器,它包含一个ICOSAP点编码器和一个双投影双向注意力融合(B2F)模块(总计约1M参数)。具体而言,ERP图像编码器可采用多种基于透视图像训练的骨干网络(如ResNet、Transformer)提取局部特征。点编码器从ICOSAP中提取全局特征。然后,B2F模块捕获ERP特征中每个像素与整个ICOSAP特征集之间语义和距离感知的依赖关系。无需特定的骨干网络设计且计算成本无明显增加,Elite360D在多个基准数据集上优于现有技术。

关键词

引用

@article{arxiv.2403.16376,
  title  = {Elite360D: Towards Efficient 360 Depth Estimation via Semantic- and Distance-Aware Bi-Projection Fusion},
  author = {Hao Ai and Lin Wang},
  journal= {arXiv preprint arXiv:2403.16376},
  year   = {2024}
}

备注

8 pages, accepted by CVPR2024