中文

GasMono:面向室内场景的几何辅助自监督单目深度估计

计算机视觉与模式识别 2023-09-29 v1

摘要

本文针对室内场景自监督单目深度估计中因帧间大旋转和低纹理所带来的挑战。我们通过多视图几何从单目序列中获取粗略相机位姿以应对前者,从而简化学习过程。然而,我们发现受训练数据集中不同场景间尺度歧义的限制,朴素地引入几何粗略位姿并不能在性能提升中发挥积极作用,这有违直觉。为解决该问题,我们提出在训练过程中通过旋转与平移/尺度优化来精炼这些位姿。为缓解低纹理的影响,我们将视觉变换器的全局推理与过拟合感知的迭代自蒸馏机制相结合,提供来自网络自身更精确的深度引导。在 NYUv2、ScanNet、7scenes 和 KITTI 数据集上的实验验证了我们框架中各组件的有效性,其在室内自监督单目深度估计上确立了新的 SOTA,并具备出色的泛化能力。代码与模型见 https://github.com/zxcqlf/GasMono

关键词

引用

@article{arxiv.2309.16019,
  title  = {GasMono: Geometry-Aided Self-Supervised Monocular Depth Estimation for Indoor Scenes},
  author = {Chaoqiang Zhao and Matteo Poggi and Fabio Tosi and Lei Zhou and Qiyu Sun and Yang Tang and Stefano Mattoccia},
  journal= {arXiv preprint arXiv:2309.16019},
  year   = {2023}
}

备注

ICCV 2023. Code: https://github.com/zxcqlf/GasMono