中文

修正预条件化语言模型优化器中的随机更新偏差

机器学习 2026-05-21 v1 人工智能 最优化与控制 机器学习

摘要

预条件化优化器是语言模型训练的核心,但其随机更新规则通常被视为对总体预条件化梯度下降的直接近似。我们指出,这种观察忽略了两个有限样本偏差:首先,梯度和预条件器通常来自同一小批量,导致梯度-预条件器耦合偏差;其次,即使预条件器估计是无偏的,其逆或逆根也通常是有偏的,因为倒数是非线性的。我们提出了一种单批次偏差纠正框架,以解决上述两种效应:交叉拟合的预条件化估计从独立的微批量组中估计分子和预条件器,而方差校正的倒数使用微批量的可变性来减去主要的delta方法偏差项。该框架适用于对角矩、对角曲率和矩阵预条件化方法,在AdamW、Sophia和Shampoo中实现。偏差纠正使Qwen2.5-0.5B的 held-out 预训练损失分别降低 0.150.150.070.070.110.11 nats;在混合质量的预训练和下游指令调优方面,效果始终为中性至积极。总体而言,这些结果表明偏差纠正是减少有限样本更新偏差并提高预条件化优化器性能的实用方法。

关键词

引用

@article{arxiv.2605.20756,
  title  = {Correcting Stochastic Update Bias in Preconditioned Language Model Optimizers},
  author = {Nikhil Nayak and Julia White and Urchade Zaratiana and Kelton Zhang and Henrijs Princis and Dhruv Atreja and Henry Fawcett and Matthew Thomas and George Hurn-Maloney and Ash Lewis},
  journal= {arXiv preprint arXiv:2605.20756},
  year   = {2026}
}

备注

32 pages, 3 figures, 13 tables