中文

大规模机器学习中 Adam 不稳定性的理论

机器学习 2023-04-26 v2 人工智能 最优化与控制

摘要

我们针对大语言模型训练中所观察到的此前无法解释的发散行为提出一种理论。我们认为该现象是训练所使用的主导优化算法 Adam 的伪影。我们观察到 Adam 可能进入一种状态,其中参数更新向量具有相对较大的范数,且与训练损失景观上下降方向基本不相关,从而导致发散。该伪影更可能出现在具有大批量大小的深度模型训练中,而这正是大规模语言模型训练的典型设定。为论证该理论,我们展示了不同规模语言模型训练过程中的观察:70 亿、300 亿、650 亿和 5460 亿参数。

关键词

引用

@article{arxiv.2304.09871,
  title  = {A Theory on Adam Instability in Large-Scale Machine Learning},
  author = {Igor Molybog and Peter Albert and Moya Chen and Zachary DeVito and David Esiobu and Naman Goyal and Punit Singh Koura and Sharan Narang and Andrew Poulton and Ruan Silva and Binh Tang and Diana Liskovich and Puxin Xu and Yuchen Zhang and Melanie Kambadur and Stephen Roller and Susan Zhang},
  journal= {arXiv preprint arXiv:2304.09871},
  year   = {2023}
}