中文

超一阶方法:基于随机共轭副梯度与AdamW训练大语言模型

机器学习 2025-07-03 v1 人工智能

摘要

随机梯度下降(SGD)方法长期以来一直是训练大型语言模型(LLMs)的核心技术。然而,随着实际应用规模的扩大,越来越多的实证研究表明其潜在的性能局限性。为此,本文提出一种针对LLMs训练的随机共轭副梯度方法,并配合自适应抽样技术。该方法不仅在每一次迭代中实现更快的收敛速度,还显示出比传统SGD技术更好的可扩展性。它利用样本复杂度分析来自适应选择样本大小,采用随机共轭副梯度方法确定搜索方向,并利用类似AdamW的算法自适应调整步长。该方法保留了一阶方法的关键优势,同时有效应对LLMs训练中固有的非凸性和非光滑性。此外,本文对该算法的优势进行了详细分析。实验结果表明,所提出的方法不仅保持了传统SGD技术的可扩展性,在许多情况下还超过了它,显著提升了优化过程的速度和准确性。

关键词

引用

@article{arxiv.2507.01241,
  title  = {Beyond First-Order: Training LLMs with Stochastic Conjugate Subgradients and AdamW},
  author = {Di Zhang and Yihang Zhang},
  journal= {arXiv preprint arXiv:2507.01241},
  year   = {2025}
}