CLIP的泛化性能主要源于高训练-测试相似度吗?
计算机视觉与模式识别
2024-03-18 v2 人工智能
机器学习
摘要
像CLIP之类的基础模型在数亿样本上训练,并能轻松泛化到新任务与输入。开箱即用时,CLIP在一系列分布外(OOD)基准上展现出卓越的零样本与少样本能力,先前工作主要将其归因于当今庞大且全面的数据集(如LAION)。然而,对于CLIP而言,“分布外泛化”等术语的意义何在值得质疑,因为像LAION这样的网络规模数据集似乎很可能包含许多与最初为ImageNet设计的常见OOD基准相似的样本。为验证该假设,我们在复现ImageNet相对于常见OOD基准的训练-测试相似度的剪枝LAION子集上重新训练CLIP。尽管我们观察到某些基准上的性能下降,但令人惊讶的是,CLIP的整体性能仍然很高。这表明高训练-测试相似度不足以解释CLIP的OOD性能,训练数据的其他属性必定驱动CLIP学习更具泛化性的表征。此外,通过剪枝与OOD基准不相似的数据点,我们发掘出一个100M的LAION子集(原规模的),在其上训练CLIP可匹配其原始OOD性能。
引用
@article{arxiv.2310.09562,
title = {Does CLIP's Generalization Performance Mainly Stem from High Train-Test Similarity?},
author = {Prasanna Mayilvahanan and Thaddäus Wiedemer and Evgenia Rusak and Matthias Bethge and Wieland Brendel},
journal= {arXiv preprint arXiv:2310.09562},
year = {2024}
}
备注
ICLR 2024 camera-ready version