中文

CLIP能够理解深度

计算机视觉与模式识别 2025-09-25 v2 人工智能 机器学习

摘要

在本文中,我们证明CLIP也可以适应于那些在网页爬取数据预训练期间其视觉-语言对齐学习得不够理想的下游任务,且无需微调。我们探索了单目深度估计这一案例,与CLIP在生成建模和语义分割等领域的成功相比,其对比先验在此任务上难以泛化。由于CLIP无法一致地捕捉图像块与描述距离的自然语言提示之间的相似性,我们摒弃了其预训练的自然语言词元嵌入,并将其冻结文本编码器的语义先验蒸馏到一个称为“mirror”的单一可学习嵌入矩阵中。mirror的主要设计目标是推导出一个非人类语言提示,以逼近一个最优的自然语言提示:“这个位置离相机有多远?”利用这种方法,我们在一个冻结的CLIP之上联合训练两个轻量级模块——一个mirror和一个紧凑解码器,用于密集深度预测。与传统的深度模型相比,我们的框架在参数和计算量方面显著更高效。所得模型表现出令人印象深刻的性能,在NYU Depth v2和KITTI基准数据集上匹配了多个最先进的视觉模型,同时优于所有基于冻结CLIP先验的视觉-语言深度模型。实验表明,CLIP在空间和时间一致性方面次优的深度理解,可以在既不微调它,也不将mirror与其预训练的子词元嵌入拼接的情况下得到显著纠正。此外,对mirror收敛状态的消融研究表明,它被隐式地训练以捕捉诸如人和窗户等物体,在这些物体中,语义线索在检测中起着重要作用。

关键词

引用

@article{arxiv.2402.03251,
  title  = {CLIP Can Understand Depth},
  author = {Sohee Kim and Jisu Kang and Dunam Kim and Seokju Lee},
  journal= {arXiv preprint arXiv:2402.03251},
  year   = {2025}
}

备注

Accepted in Pattern Recognition, 2025