是什么让CLIP对长尾预训练数据更具鲁棒性?一项可迁移见解的受控研究
计算机视觉与模式识别
2024-10-29 v3 计算与语言
机器学习
摘要
网络规模的视觉-语言数据集中天然存在严重的数据不平衡。尽管如此,我们发现基于这些数据预训练的CLIP相比监督学习对数据不平衡表现出显著的鲁棒性,并在学习可泛化表示方面展现出显著的有效性。为了探究这一发现背后的原因,我们进行了受控实验来研究各种潜在因素,并揭示出CLIP的预训练任务形成了一个动态分类问题,其中训练中只出现部分类别。这隔离了来自主导类别的偏差,并隐式地平衡了学习信号。此外,CLIP的鲁棒性和判别能力随着更具描述性的语言监督、更大的数据规模和更广泛的开放世界概念而提升,而这些是监督学习无法获得的。我们的研究不仅揭示了CLIP超越数据不平衡的泛化机制,还为研究社区提供了可迁移的见解。这些发现在监督学习和自监督学习中都得到了验证,使得在不平衡数据上训练的模型能够在多种识别任务上达到CLIP级别的性能。代码和数据见:https://github.com/CVMI-Lab/clip-beyond-tail。
引用
@article{arxiv.2405.21070,
title = {What Makes CLIP More Robust to Long-Tailed Pre-Training Data? A Controlled Study for Transferable Insights},
author = {Xin Wen and Bingchen Zhao and Yilun Chen and Jiangmiao Pang and Xiaojuan Qi},
journal= {arXiv preprint arXiv:2405.21070},
year = {2024}
}
备注
Accepted at NeurIPS 2024