通过非局部密集预测Transformer与监督自监督联合学习改进360单目深度估计
计算机视觉与模式识别
2023-04-17 v3
摘要
由于等距矩形(360)图像真实深度获取的困难,当今等距矩形深度数据的数量与质量不足以表征世界中的各类场景。因此,仅依赖监督学习的360深度估计研究注定产生不尽人意的结果。尽管引入了聚焦于等距矩形图像(EIs)的自监督学习方法,它们常具有不正确或非唯一解,导致性能不稳定。本文中,我们提出了改进以往研究局限之处的360单目深度估计方法。首先,我们引入一种仅利用重力对齐视频的自监督360深度学习方法,其有潜力在训练过程中消除对深度数据的需求。其次,我们提出一种通过结合监督与自监督学习实现的联合学习方案。两种学习各自的弱点得以互补,从而获得更精确的深度估计。第三,我们提出一种非局部融合模块,其能在重建深度时进一步保留视觉Transformer编码的全局信息。借助所提方法,我们成功将Transformer应用于360深度估计,据我们所知,这是此前未被尝试过的。在多个基准上,我们的方法相较以往工作取得了显著改进并确立了当前最优(state of the art)。
引用
@article{arxiv.2109.10563,
title = {Improving 360 Monocular Depth Estimation via Non-local Dense Prediction Transformer and Joint Supervised and Self-supervised Learning},
author = {Ilwi Yun and Hyuk-Jae Lee and Chae Eun Rhee},
journal= {arXiv preprint arXiv:2109.10563},
year = {2023}
}
备注
14 pages, Accepted to AAAI22, conference preprint version