通过梯度分组缩放学习率驯服 LLM
机器学习
2025-06-03 v1 人工智能
摘要
由于大规模和异构架构,训练大语言模型 (LLM) 面临挑战。虽然像 AdamW 这样的自适应优化器有助于解决梯度变异问题,但它们在高效且有效的逐参数学习率估计方面仍然存在困难,导致训练不稳定、收敛缓慢,并且与参数高效微调 (PEFT) 技术的兼容性差。这项工作引入了梯度分组缩放 (SGG),这是一种优化器包装器,通过动态分组和特定组缩放来改进自适应学习率估计。SGG 首先将每层的梯度统计量聚类成簇,然后应用特定簇的缩放来校准每个参数的学习率,从而在保持精确的逐参数适应的同时施加集体分组约束。在多样 (M)LLM 基准上的实验表明,SGG 与现有优化器无缝集成,在各种模型规模下比基线提供了一致的增益和更快的收敛。其在不同批大小和学习率下的稳定性确立了 SGG 作为 LLM 优化的鲁棒选择。
引用
@article{arxiv.2506.01049,
title = {Taming LLMs by Scaling Learning Rates with Gradient Grouping},
author = {Siyuan Li and Juanxi Tian and Zedong Wang and Xin Jin and Zicheng Liu and Wentao Zhang and Dan Xu},
journal= {arXiv preprint arXiv:2506.01049},
year = {2025}
}
备注
Preprint version of "Taming LLMs with Gradient Grouping" (ACL'2025). The code will be available at https://github.com/ScalingOpt/SGG