中文

重尾类别不平衡以及为何 Adam 在语言模型上优于梯度下降

机器学习 2024-07-15 v2 计算与语言 最优化与控制 机器学习

摘要

Adam 已被证明在大型语言模型上的表现优于梯度下降,且其优势幅度大于在其他任务上的表现,但其原因尚不明确。我们表明,造成这种性能差距的关键因素是语言任务中存在的重尾类别不平衡(heavy-tailed class imbalance)。当使用梯度下降进行训练时,罕见词的损失下降速度慢于常见词。由于大多数样本来自罕见词,这导致平均损失下降缓慢。另一方面,Adam 和基于符号(sign-based)的方法对此问题不太敏感。为了确定这种行为是由类别不平衡引起的,我们通过实证表明,它可以在语言 Transformer、视觉 CNN 和线性模型等不同架构和数据类型中复现。在具有交叉熵损失的线性模型上,我们表明类别不平衡会导致不平衡且相关的梯度和海森矩阵,而这被认为有利于 Adam。我们还证明,在连续时间下,梯度下降在低频类别上收敛缓慢,而符号下降(sign descent)则不然。

关键词

引用

@article{arxiv.2402.19449,
  title  = {Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models},
  author = {Frederik Kunstner and Robin Yadav and Alan Milligan and Mark Schmidt and Alberto Bietti},
  journal= {arXiv preprint arXiv:2402.19449},
  year   = {2024}
}