FastCLIP:加速大规模数据下 CLIP 训练的有限资源下的优化技术套件
机器学习
2024-10-03 v3 计算机视觉与模式识别
摘要
现有训练领先对比语言-图像预训练(CLIP)模型的研究在大规模数据上需要数百乃至数千个 GPU,因为需要较大的 batch 大小。然而,这种大量资源对大多数人而言并不易获得。虽然针对全局对比损失的高级组合优化技术已被证明有效,可消除大 batch 大小的需求,但其在大规模数据上的表现仍未得到充分探索和优化。为弥合这一差距,本文在有限资源(如最多几十个 GPU)下的 CLIP 训练中,探索了多个方面。首先,我们引入 FastCLIP,一个基于高级组合优化技术构建的通用 CLIP 训练框架,专为分布式环境设计和优化。该框架配备了高效梯度归约策略,以减少通信开销。其次,为进一步提升训练效率,我们从优化角度考察框架的三个组成部分:内学习率的调度策略、温度参数和模型参数的更新规则。对每个组成部分的不同策略进行实验,为如何更高效地进行 CLIP 训练提供了指导。最后,我们在不同计算规模(最高达 32 GPU,8 节点)和不同数据规模(从 270 万、910 万到 3.15 亿张图像-文本对)上,对 FastCLIP 与最先进的训练基线(OpenCLIP)进行基准测试,展示了 FastCLIP 在资源受限环境下的显著性能提升。我们在 https://github.com/Optimization-AI/fast_clip 上发布了 FastCLIP 的代码。
引用
@article{arxiv.2407.01445,
title = {FastCLIP: A Suite of Optimization Techniques to Accelerate CLIP Training with Limited Resources},
author = {Xiyuan Wei and Fanjiang Ye and Ori Yonay and Xingyu Chen and Baixi Sun and Dingwen Tao and Tianbao Yang},
journal= {arXiv preprint arXiv:2407.01445},
year = {2024}
}
备注
29 pages