没有指数数据就没有“零样本”:预训练概念频率决定多模态模型性能
计算机视觉与模式识别
2024-10-30 v3 计算与语言
机器学习
摘要
网页爬取的预训练数据构成了多模态模型(如CLIP用于分类/检索,Stable-Diffusion用于图像生成)在“零样本”评估中的惊人性能。然而,对于此类多模态模型而言,“零样本”概念的意义是否值得被认为,尚不明确,因为我们尚不知道其预训练数据是否包含用于“零样本”评估的下游概念。本文我们询问:多模态模型在下游概念上的性能如何受其预训练数据中这些概念频率的影响?我们跨34个模型和5个标准预训练数据集(CC-3M、CC-12M、YFCC-15M、LAION-400M、LAION-Aesthetics)进行系统性调查,生成了超过300GB的数据制品。我们一致发现,多模态模型并不表现出“零样本”泛化,相反,它们需要指数级的数据才能在下游“零样本”性能上实现线性改进,遵循一种样本效率低的对数线性扩展趋势。即使控制了预训练数据与下游数据集在样本层面的相似性,测试在纯合成数据分布上,也存在这一趋势。此外,基于我们的分析,对模型进行长尾数据采样基准测试,结果显示各类多模态模型均表现不佳。我们贡献的长尾测试集作为“让它摇摆!”基准将进一步推动此方向的研究。总体而言,本研究揭示了训练数据对“零样本”泛化能力的指数需求,这一关键在于大规模训练范式下的“零样本”泛化能力的实现方式仍需进一步探索。
引用
@article{arxiv.2404.04125,
title = {No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance},
author = {Vishaal Udandarao and Ameya Prabhu and Adhiraj Ghosh and Yash Sharma and Philip H. S. Torr and Adel Bibi and Samuel Albanie and Matthias Bethge},
journal= {arXiv preprint arXiv:2404.04125},
year = {2024}
}
备注
Short version accepted at DPFM, ICLR'24; Full paper at NeurIPS'24