批量大小不变的 Adam
机器学习
2024-03-01 v1
摘要
我们提出了一种批量大小不变的 Adam 变体,适用于大规模分布式设置。在这种设置下,小批量被划分为微批量,并分布在工作节点之间。对于 v 项,标准 Adam 首先计算微批量梯度的平均值,然后平方;而本文中提出的批量大小不变 Adam 则首先对微批量梯度平方后再取平均。以前的工作(例如 Malladi 等人 2022)采用了另一种方法,即对学习率进行平方根缩放,但这种方法需要强假设;特别是梯度方差必须大于预期梯度的平方。在 contrastively地,本文提出的方法无需该假设即可实现批量大小不变。我们在实践中确认,本方案在 much 更大的情景范围内实现了批量大小不变,这超越了以前方法的范围。
引用
@article{arxiv.2402.18824,
title = {Batch size invariant Adam},
author = {Xi Wang and Laurence Aitchison},
journal= {arXiv preprint arXiv:2402.18824},
year = {2024}
}