SGFormer:面向 360 深度估计的球几何 Transformer
计算机视觉与模式识别
2025-02-26 v3 人工智能
摘要
全景畸变在 360 深度估计中构成重大挑战,尤其在北部和南部极地尤为突出。现有方法要么采用双投影融合策略以消除畸变,要么建模长程依赖以捕获全局结构,这会导致结构不清晰或局部感知不足。本文提出一种球几何 Transformer,称为 SGFormer,旨在解决上述问题,创新性地将球几何先验引入视觉 Transformer。为此,我们将 Transformer 解码器重新定位为球先验解码器 (SPDecoder),旨在在解码过程中保持球形结构的完整性。具体地,我们利用双极重投影、圆形旋转和曲线局部嵌入来分别保留等距、连续性和曲面距离的球体特征。此外,我们提出一种基于查询的全局条件位置嵌入,以补偿不同分辨率下的空间结构。它不仅提升了空间位置的全局感知,还锐化了不同 patch 区域的深度结构。最后,我们在流行的基准数据集上进行了大量实验,证明了我们在 state-of-the-art 解决方案上的优势。
引用
@article{arxiv.2404.14979,
title = {SGFormer: Spherical Geometry Transformer for 360 Depth Estimation},
author = {Junsong Zhang and Zisong Chen and Chunyu Lin and Lang Nie and Zhijie Shen and Kang Liao and Junda Huang and Yao Zhao},
journal= {arXiv preprint arXiv:2404.14979},
year = {2025}
}