MonoViT:基于视觉Transformer的自监督单目深度估计
计算机视觉与模式识别
2023-03-24 v1
摘要
自监督单目深度估计是一种颇具吸引力的方案,其训练不需要难以获取的深层标签。卷积神经网络(CNNs)近年来在该任务上取得了巨大成功。然而,其有限的感受野限制了现有网络架构只能进行局部推理,削弱了自监督范式的有效性。鉴于视觉Transformer(ViTs)近期取得的成功,我们提出MonoViT,一种将ViT模型所支持的全局推理与自监督单目深度估计的灵活性相结合的崭新框架。通过将普通卷积与Transformer模块相结合,我们的模型能够进行局部与全局推理,以更高层次的细节和精度生成深度预测,使MonoViT在成熟的KITTI数据集上达到最先进性能。此外,MonoViT在Make3D和DrivingStereo等其他数据集上证明了其优越的泛化能力。
引用
@article{arxiv.2208.03543,
title = {MonoViT: Self-Supervised Monocular Depth Estimation with a Vision Transformer},
author = {Chaoqiang Zhao and Youmin Zhang and Matteo Poggi and Fabio Tosi and Xianda Guo and Zheng Zhu and Guan Huang and Yang Tang and Stefano Mattoccia},
journal= {arXiv preprint arXiv:2208.03543},
year = {2023}
}
备注
Accepted by 3DV 2022