对比语言-图像学习的可复现缩放定律
机器学习
2024-07-16 v2 人工智能
计算机视觉与模式识别
摘要
扩大神经网络规模已在广泛任务上带来卓越性能。此外,性能常作为训练集规模、模型规模和计算量的函数遵循可靠的缩放定律,这在大规模实验日益昂贵的当下提供了宝贵指导。然而,先前关于缩放定律的工作主要使用私有数据与模型,或聚焦于单模态语言或视觉学习。为弥补这些局限,我们利用公开 LAION 数据集与开源 OpenCLIP 代码库研究对比语言-图像预训练(CLIP)的缩放定律。我们的大规模实验涉及在多达二十亿图文对上训练的模型,并识别出包括零样本分类、检索、线性探测和端到端微调在内的多个下游任务的幂律缩放。我们发现训练分布对缩放定律起关键作用:尽管模型架构相同且训练方案相似,OpenAI 与 OpenCLIP 模型表现出不同的缩放行为。我们开源了评估流程与所有模型(含最大的公开 CLIP 模型),以确保可复现性并使缩放定律研究更易获取。本研究的源代码与复现说明将发布于 https://github.com/LAION-AI/scaling-laws-openclip
引用
@article{arxiv.2212.07143,
title = {Reproducible scaling laws for contrastive language-image learning},
author = {Mehdi Cherti and Romain Beaumont and Ross Wightman and Mitchell Wortsman and Gabriel Ilharco and Cade Gordon and Christoph Schuhmann and Ludwig Schmidt and Jenia Jitsev},
journal= {arXiv preprint arXiv:2212.07143},
year = {2024}
}
备注
CVPR 2023. Version with minor extension. Original: https://openaccess.thecvf.com/content/CVPR2023/html/Cherti_Reproducible_Scaling_Laws_for_Contrastive_Language-Image_Learning_CVPR_2023_paper