中文

CLIP训练中的逆缩放律

计算机视觉与模式识别 2023-10-31 v2

摘要

CLIP作为连接图像与文本的先驱基础模型之一,促成了计算机视觉中许多近期突破。然而,其相关的训练成本极高,对其广泛探索构成了显著障碍。本文中,我们呈现了一个令人惊讶的发现:CLIP训练中存在逆缩放律,即所用的图像/文本编码器越大,训练中可应用的图像/文本token序列长度越短。此外,我们展示了缩减图像/文本token长度的策略在决定该缩放律质量方面起着关键作用。基于该发现,我们即使在有限计算资源下也能成功训练CLIP。例如,使用8块A100 GPU,我们的CLIP模型在约2天、约3天和约4天内分别取得了63.2%、67.8%和69.3%的ImageNet-1k零样本top-1准确率。我们的方法在扩大规模时同样表现良好——使用G/14,我们创下了83.0%的ImageNet-1k零样本准确率新纪录,同时相比其OpenCLIP对应版本将训练加速了约33倍。通过降低CLIP相关的计算壁垒,我们希望激发该领域更多研究,尤其是来自学术界的研究。我们的代码可在 https://github.com/UCSC-VLAA/CLIPA 获取。

关键词

引用

@article{arxiv.2305.07017,
  title  = {An Inverse Scaling Law for CLIP Training},
  author = {Xianhang Li and Zeyu Wang and Cihang Xie},
  journal= {arXiv preprint arXiv:2305.07017},
  year   = {2023}
}

备注

NeurIPS 2023 camera-ready