MeSa:面向单目深度估计的掩码、几何与有监督预训练
计算机视觉与模式识别
2023-10-10 v1
摘要
近年来,预训练已成为开发强大单目深度估计模型的重要组成部分。例如,自监督学习(SSL)通过缓解对具有密集真实深度图的大型数据集的需求而特别有效。然而,尽管有这些改进,我们的研究揭示出当前最先进(SOTA)SSL方法的后几层实际上并非最优。通过检查逐层表示,我们证明了这些后几层在微调期间发生了显著变化,表明其预训练特征对深度估计无效。为解决这些局限,我们提出MeSa,一个利用掩码、几何与有监督预训练互补优势的综合框架。因此,MeSa不仅受益于通过掩码预训练学习的通用表示,还受益于通过几何与有监督预训练获得的专用深度特征。我们的CKA逐层分析证实,我们的预训练策略确实为后几层生成了改进的表示,克服了SOTA SSL方法的缺陷。此外,通过在NYUv2和IBims-1数据集上的实验,我们证明这些增强的表示转化为分布内和分布外设定下的性能提升。我们还研究了预训练数据集的影响,并证明了在LSUN上预训练的有效性,其产生了显著更好的预训练表示。总体而言,我们的方法在RMSE上以17.1%的幅度大幅超越掩码预训练SSL方法。此外,即使未使用任何近期提出的技术,MeSa也优于最新方法,并在具有挑战性的NYUv2数据集上确立了单目深度估计的新最先进水平。
引用
@article{arxiv.2310.04551,
title = {MeSa: Masked, Geometric, and Supervised Pre-training for Monocular Depth Estimation},
author = {Muhammad Osama Khan and Junbang Liang and Chun-Kai Wang and Shan Yang and Yu Lou},
journal= {arXiv preprint arXiv:2310.04551},
year = {2023}
}