符号下降的可证明优势:重尾不平衡下的最小模型
机器学习
2025-12-02 v1 人工智能
摘要
自适应优化方法(如 Adam)在大型语言模型预训练中发挥关键作用,显著优于梯度下降 (GD)。近期研究提出了针对损失函数的新型光滑性假设,以解释自适应算法(如坐标级或层级自适应预条件器)以及相对于非欧几里得范数(如 范数或谱范数)的最陡下降方法相对于 GD 的优势。然而,这些光滑性假设在语言建模任务中如何体现仍不清晰。本文旨在从数据分布的属性——即重尾不平衡——直接分析 范数下降(即符号下降)的优势。我们提出一种最小且具代表性的下一个标记预测设置,能够在重尾不平衡存在时,证明坐标级算法如符号下降(相对于 范数的归一化 GD)在收敛速度上具有显著优势。
引用
@article{arxiv.2512.00763,
title = {Provable Benefit of Sign Descent: A Minimal Model Under Heavy-Tailed Class Imbalance},
author = {Robin Yadav and Shuo Xie and Tianhao Wang and Zhiyuan Li},
journal= {arXiv preprint arXiv:2512.00763},
year = {2025}
}