中文

轻量级提示引导的 CLIP 适应方法用于单目深度估计

计算机视觉与模式识别 2026-04-02 v1 人工智能 机器学习

摘要

利用视觉语言模型(VLM)如 CLIP 在单目深度估计任务中所具备的丰富语义特征是一个具有潜力的方向,但通常需要大量微调或缺乏几何精度。我们提出了名为 MoA-DepthCLIP 的参数高效框架,通过最小化监督信息来适配预训练的 CLIP 表示用于单目深度估计。该方法将轻量级混合适配器(MoA)模块集成到预训练的 Vision Transformer(ViT-B/32)主干网络中,同时对最终层进行选择性微调。这种设计使模型能够受由全局语义上下文向量和混合预测架构(协同深度二分类与直接回归)所引导的空间感知适应成为可能。为增强结构精度,我们采用复合损失函数以强制几何约束。在 NYU Depth V2 数据集上,MoA-DepthCLIP 实现了具竞争力的结果,显著优于 DepthCLIP 基线,使 δ1\delta_1 精度从 0.390 提升至 0.745,RMSE 从 1.176 降至 0.520。尽管如此,这些结果是以需要可少参数的情况下实现的,表明轻量级、提示引导的 MoA 是将 VLM 知识高效迁移到细粒度单目深度估计任务的有效策略。

关键词

引用

@article{arxiv.2604.01118,
  title  = {Lightweight Prompt-Guided CLIP Adaptation for Monocular Depth Estimation},
  author = {Reyhaneh Ahani Manghotay and Jie Liang},
  journal= {arXiv preprint arXiv:2604.01118},
  year   = {2026}
}

备注

14 pages, 2 figures