EGformer:面向 360 度深度估计的等距矩形几何偏置 Transformer
计算机视觉与模式识别
2023-09-08 v2
摘要
鉴于等距矩形(即 360 度)图像(EIs)具有畸变的 180 x 360 视场,其深度估计具有挑战性,难以通过卷积神经网络(CNN)解决。尽管具有全局注意力的 transformer 在 EI 深度估计任务上相比 CNN 取得了显著改进,但其计算效率低,这引发了对具有局部注意力的 transformer 的需求。然而,要在 EIs 上成功应用局部注意力,需要一种同时解决畸变等距矩形几何与有限感受野的特定策略。先前工作仅关注其中之一,偶尔导致不理想的深度结果。本文中,我们提出一种称为 EGformer 的等距矩形几何偏置 transformer。在限制计算成本与网络参数数量的同时,EGformer 能够以大感受野提取等距矩形几何感知的局部注意力。为此,我们主动利用等距矩形几何作为局部注意力的偏置,而非费力地降低 EIs 的畸变。与最新的 EI 深度估计研究相比,所提方法以最低的计算成本和最少的参数总体产生了最佳深度结果,证明了所提方法的有效性。
引用
@article{arxiv.2304.07803,
title = {EGformer: Equirectangular Geometry-biased Transformer for 360 Depth Estimation},
author = {Ilwi Yun and Chanyong Shin and Hyunku Lee and Hyuk-Jae Lee and Chae Eun Rhee},
journal= {arXiv preprint arXiv:2304.07803},
year = {2023}
}
备注
12 pages, Accepted to ICCV23, Camera ready version