中文

通过非局部密集预测Transformer与监督自监督联合学习改进360单目深度估计

计算机视觉与模式识别 2023-04-17 v3

摘要

由于等距矩形(360)图像真实深度获取的困难,当今等距矩形深度数据的数量与质量不足以表征世界中的各类场景。因此,仅依赖监督学习的360深度估计研究注定产生不尽人意的结果。尽管引入了聚焦于等距矩形图像(EIs)的自监督学习方法,它们常具有不正确或非唯一解,导致性能不稳定。本文中,我们提出了改进以往研究局限之处的360单目深度估计方法。首先,我们引入一种仅利用重力对齐视频的自监督360深度学习方法,其有潜力在训练过程中消除对深度数据的需求。其次,我们提出一种通过结合监督与自监督学习实现的联合学习方案。两种学习各自的弱点得以互补,从而获得更精确的深度估计。第三,我们提出一种非局部融合模块,其能在重建深度时进一步保留视觉Transformer编码的全局信息。借助所提方法,我们成功将Transformer应用于360深度估计,据我们所知,这是此前未被尝试过的。在多个基准上,我们的方法相较以往工作取得了显著改进并确立了当前最优(state of the art)。

关键词

引用

@article{arxiv.2109.10563,
  title  = {Improving 360 Monocular Depth Estimation via Non-local Dense Prediction Transformer and Joint Supervised and Self-supervised Learning},
  author = {Ilwi Yun and Hyuk-Jae Lee and Chae Eun Rhee},
  journal= {arXiv preprint arXiv:2109.10563},
  year   = {2023}
}

备注

14 pages, Accepted to AAAI22, conference preprint version