CLIP 结合模型库专家:用于视觉增强的伪监督
机器学习
2023-10-24 v1 人工智能
计算机视觉与模式识别
摘要
对比语言-图像预训练(CLIP)是训练视觉-语言模型的标准方法。尽管 CLIP 在图像分类任务上具有可扩展、可提示以及对分布偏移鲁棒的优点,但它缺乏目标定位能力。本文研究以下问题:我们能否用模型库中的任务专用视觉模型来增强 CLIP 训练以改进其视觉表征?为此,我们利用开源的任务专用视觉模型为未经整理且含噪的图像-文本数据集生成伪标签。随后,我们在图像和文本对上进行对比训练之外,还在这些伪标签上训练 CLIP 模型。这一简单设置在不同视觉任务上显示出高达 16.3% 的显著提升,包括分割、检测、深度估计和表面法线估计。重要的是,这些增强是在不损害 CLIP 现有能力的前提下实现的,包括其在可提示零样本分类上的熟练度。
引用
@article{arxiv.2310.14108,
title = {CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement},
author = {Mohammadreza Salehi and Mehrdad Farajtabar and Maxwell Horton and Fartash Faghri and Hadi Pouransari and Raviteja Vemulapalli and Oncel Tuzel and Ali Farhadi and Mohammad Rastegari and Sachin Mehta},
journal= {arXiv preprint arXiv:2310.14108},
year = {2023}
}