PanoFormer:面向室内360度深度估计的全景Transformer
计算机视觉与模式识别
2022-07-13 v2
摘要
现有基于卷积神经网络(CNN)的全景深度估计方法聚焦于消除全景畸变,由于CNN中固定的感受野,未能高效感知全景结构。本文提出全景Transformer(命名为PanoFormer)来估计全景图像中的深度,其采用来自球域的切向块、可学习的令牌流以及全景特定度量。具体而言,我们将球切域上的块划分为令牌以减少全景畸变的负面影响。由于几何结构对深度估计至关重要,自注意力模块被重新设计以加入额外的可学习令牌流。此外,考虑到球域特性,我们提出两个全景特定度量来全面评估全景深度估计模型的性能。大量实验表明我们的方法显著优于最先进(SOTA)方法。进一步地,所提方法可有效扩展以解决语义全景分割这一类似的像素到像素任务。代码将公开。
引用
@article{arxiv.2203.09283,
title = {PanoFormer: Panorama Transformer for Indoor 360 Depth Estimation},
author = {Zhijie Shen and Chunyu Lin and Kang Liao and Lang Nie and Zishuo Zheng and Yao Zhao},
journal= {arXiv preprint arXiv:2203.09283},
year = {2022}
}
备注
Accepted to ECCV2022