面向大规模视觉-语言模型的稳定低精度训练
机器学习
2023-10-18 v2 计算机视觉与模式识别
摘要
我们提出了用于 1)加速和 2)稳定大规模语言-视觉模型训练的新方法。1)在加速方面,我们引入 SwitchBack,一种用于 int8 量化训练的线性层,在 1B 参数的 CLIP ViT-Huge(迄今最大的 int8 训练)上实现了 13-25% 的加速,同时在 0.1 个百分点内匹配 bfloat16 训练的性能。我们的主要关注点是 int8,因为 GPU 对 float8 的支持很少,尽管我们也通过仿真分析了 float8 训练。虽然 SwitchBack 对 float8 证明有效,但我们表明,如果网络经过训练和初始化以抑制大的特征幅值(我们通过以零初始化的 layer-scale 实现),标准技术也同样成功。2)在稳定性方面,我们分析了损失尖峰,发现它们一致地发生在平方梯度被其 AdamW 二阶矩估计器低估后的 1-8 次迭代。因此,我们推荐一种 AdamW-Adafactor 混合方法,其在训练 CLIP ViT-Huge 模型时避免损失尖峰,并在我们所测试的尺度上优于梯度裁剪。
引用
@article{arxiv.2304.13013,
title = {Stable and low-precision training for large-scale vision-language models},
author = {Mitchell Wortsman and Tim Dettmers and Luke Zettlemoyer and Ari Morcos and Ali Farhadi and Ludwig Schmidt},
journal= {arXiv preprint arXiv:2304.13013},
year = {2023}
}
备注
NeurIPS 2023