DepthCues:评估大规模视觉模型中的单目深度感知
计算机视觉与模式识别
2025-03-20 v3
摘要
大规模预训练视觉模型正变得越来越普遍,提供了具有表达力和可泛化性的视觉表征,益处于各种下游任务。最近的研究揭示了这些模型的显现属性,尤其在深度感知语境下,显示出高级几何理解能力。然而,如何在预训练过程中未提供显式深度监督的情况下,深度感知如何在这些模型中产生,仍不明确。为此,我们考察单目深度线索是否类似于人类视觉系统所使用的那些,是否在这些模型中显现。我们引入了一个新的基准测试 DepthCues,用于评估深度线索理解,并在20个多样且具代表性的预训练视觉模型上呈现发现。我们的分析表明,人类式的深度线索在较新的更大模型中显现。我们还探索了通过在DepthCues上微调来增强大型视觉模型的深度感知能力,发现即使没有稠密深度监督,这也能改善深度估计。为支持进一步的研究,我们的基准测试和评估代码将公开提供,以用于研究视觉模型中的深度感知。
引用
@article{arxiv.2411.17385,
title = {DepthCues: Evaluating Monocular Depth Perception in Large Vision Models},
author = {Duolikun Danier and Mehmet Aygün and Changjian Li and Hakan Bilen and Oisin Mac Aodha},
journal= {arXiv preprint arXiv:2411.17385},
year = {2025}
}
备注
Accepted to CVPR 2025. Project page: https://danier97.github.io/depthcues/