中文

学习自适应CLIP用于少样本单目深度估计

计算机视觉与模式识别 2023-11-03 v1

摘要

预训练的视觉-语言模型(VLMs),如CLIP,在涉及视觉与语言模态融合的一系列任务中展现出增强的性能。当CLIP用于深度估计任务时,从输入图像划分出的图像块可与一系列深度信息的语义描述相结合以获得相似度结果。随后通过对对应于预定义语义描述的深度值(称为深度箱)进行加权求和,实现深度的粗估计。这种零样本方法规避了传统全监督深度估计方法计算密集和耗时的特性。然而,该方法使用固定的深度箱,可能无法有效泛化,因为不同场景的图像可能呈现不同的深度分布。为应对这一挑战,我们提出一种基于少样本的方法,学习使VLMs适应单目深度估计,以平衡训练成本与泛化能力。具体而言,它为不同场景分配不同的深度箱,模型在推理时可进行选择。此外,我们引入可学习提示对输入文本进行预处理,将易于人类理解的文本转换为易于模型理解的向量,并进一步提升性能。仅在每场景一张图像用于训练的情况下,我们在NYU V2和KITTI数据集上的大量实验结果表明,我们的方法在MARE指标上比先前最先进方法高出至多10.6%。

关键词

引用

@article{arxiv.2311.01034,
  title  = {Learning to Adapt CLIP for Few-Shot Monocular Depth Estimation},
  author = {Xueting Hu and Ce Zhang and Yi Zhang and Bowen Hai and Ke Yu and Zhihai He},
  journal= {arXiv preprint arXiv:2311.01034},
  year   = {2023}
}

备注

Accepted by WACV 2024