带有高质量描述的 CLIP:视觉任务的强预训练
计算机视觉与模式识别
2024-05-16 v1 机器学习
摘要
CLIP 模型在零样本分类和检索任务中表现优异。但最近的研究表明,CLIP 学习到的表示并不适合密集预测任务,如目标检测、语义分割或深度估计。最近,引入了 CLIP 模型的多阶段训练方法,以缓解 CLIP 在下游任务上的性能不足。在这项工作中,我们发现,仅仅提高图像文本数据集中描述的质量就能改善 CLIP 视觉表示的质量,从而在下游密集预测视觉任务上取得显著提升。事实上,我们发现使用高质量描述进行 CLIP 预训练可以超越近期的有监督、自监督和弱监督预训练方法。我们表明,当使用 ViT-B/16 作为图像编码器的 CLIP 模型在良好对齐的图文对上进行训练时,在语义分割和深度估计任务上,相较于近期的最先进掩码图像建模(MIM)预训练方法(如掩码自编码器,MAE),其 mIoU 提高了 12.1%,RMSE 降低了 11.5%。我们发现移动架构也能从 CLIP 预训练中显著受益。一种近期的移动视觉架构 MCi2,经过 CLIP 预训练后,在语义分割任务上获得了与在 ImageNet-22k 上预训练的 Swin-L 相当的性能,且模型小了 6.1。此外,我们表明,提高描述质量在微调密集预测任务时可带来 的数据效率。
引用
@article{arxiv.2405.08911,
title = {CLIP with Quality Captions: A Strong Pretraining for Vision Tasks},
author = {Pavan Kumar Anasosalu Vasu and Hadi Pouransari and Fartash Faghri and Oncel Tuzel},
journal= {arXiv preprint arXiv:2405.08911},
year = {2024}
}