中文

面向开放式基础语言-视觉模型与数据集的鲁健比较的比例规律

机器学习 2025-06-06 v1 人工智能 计算机视觉与模式识别

摘要

在可迁移学习研究中,已获得 various 基础模型的比例规律,以预测其在更大规模下的属性和性能。我们在此表明,比例规律的推导也可用于模型和数据集比较,以决定预训练中应优先采用的方案。首次基于对 model 与 samples seen 规模范围内稠密测量,为两种重要语言-视觉学习方案(CLIP 和 MaMMUT)推导完整比例规律,这两种方案分别采用仅对比损失或对比损失和 captioning 文本生成损失。确保对 held out 点的预测准确性,我们使用推导出的比例规律来比较两种模型,获得了 MaMMUT 随规模增长更快的改进以及更好样本效率的证据,优于标准 CLIP。为加强比较的有效性,我们展示了用于 various downstream 任务(分类、检索和分割)以及不同开放数据集(DataComp、DFN 和 Re-LAION)的比例规律,观察到一致的相同趋势。我们表明,仅使用恒定学习率计划即可进行比较,这有助于降低计算成本。准确推导比例规律因此为在 scale spans 内进行模型和数据集比较提供了手段,避免仅凭单一参考规模测量得出的误导性结论,为其创建铺平了系统比较和改进开放基础模型和数据集之路。我们发布了所有预训练模型及其中间检查点,包括 openMaMMUT-L/14,在 DataComp-1.4B 上训练的 128B 样本,实现了 80.3% 的 zero-shot ImageNet-1k accuracy。复现实验的代码和原始实验数据可在 https://github.com/LAION-AI/scaling-laws-for-comparison 找到。

关键词

引用

@article{arxiv.2506.04598,
  title  = {Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets},
  author = {Marianna Nezhurina and Tomer Porian and Giovanni Pucceti and Tommie Kerssies and Romain Beaumont and Mehdi Cherti and Jenia Jitsev},
  journal= {arXiv preprint arXiv:2506.04598},
  year   = {2025}
}

备注

Preprint. In Review