中文

SphereFusion:基于门控融合的高效全景深度估计

计算机视觉与模式识别 2025-02-11 v1

摘要

由于全景相机的快速发展,全景深度估计任务已引起计算机视觉社区的广泛关注,尤其在机器人感知和自动驾驶等应用中。然而,现有方法由于依赖不同的投影格式,常面临挑战:要么在等距投影、立方体投影和切向投影中处理畸变和不连续性,要么在球面投影中出现纹理细节丢失。为解决这些问题,我们提出SphereFusion,一个结合多种投影方法优势的端到端框架。具体而言,SphereFusion初始采用2D图像卷积和网格操作,从全景图像在等距和球面投影域中提取两种不同类型的特征。这些特征随后投影到球面域,在此域上,门控融合模块选择最可靠的特征进行融合。最终,SphereFusion在球面域内估计全景深度。同时,SphereFusion采用缓存策略提高网格操作效率。在三个公开全景数据集上的大量实验表明,SphereFusion以竞争姿态达成其他最先进方法的成绩,同时仅需17毫秒即可完成512×1024全景图像的推理。

关键词

引用

@article{arxiv.2502.05859,
  title  = {SphereFusion: Efficient Panorama Depth Estimation via Gated Fusion},
  author = {Qingsong Yan and Qiang Wang and Kaiyong Zhao and Jie Chen and Bo Li and Xiaowen Chu and Fei Deng},
  journal= {arXiv preprint arXiv:2502.05859},
  year   = {2025}
}

备注

3DV 2025