GLPanoDepth:从全局到局部的全景深度估计
计算机视觉与模式识别
2022-02-09 v2
摘要
本文中,我们提出一种基于学习的方法,从单目全向图像预测场景的稠密深度值。全向图像具有全视场,比透视图像提供更完整的场景描述。然而,当前多数方案依赖的全卷积网络无法从全景图中捕获丰富的全局上下文。为解决该问题以及全景图中等距柱状投影的畸变,我们提出立方体贴图视觉变换器(CViT),一种基于变换器的新架构,可建模长程依赖并从全景图中提取无畸变的全局特征。我们表明立方体贴图视觉变换器在每个阶段都具有全局感受野,并能为球面信号提供全局一致的预测。为保留重要的局部特征,我们在流水线中进一步设计了一个基于卷积的分支(称为 GLPanoDepth),并在多个尺度上融合来自立方体贴图视觉变换器的全局特征。这种从全局到局部的策略使我们能够充分利用全景图中有用的全局与局部特征,在全景深度估计中达到最先进的性能。
引用
@article{arxiv.2202.02796,
title = {GLPanoDepth: Global-to-Local Panoramic Depth Estimation},
author = {Jiayang Bai and Shuichang Lai and Haoyu Qin and Jie Guo and Yanwen Guo},
journal= {arXiv preprint arXiv:2202.02796},
year = {2022}
}