中文

神经比例定律中的优化器依赖性

机器学习 2026-05-29 v1 人工智能 机器学习

摘要

神经比例定律中的比例指数 α\alpha 通常被视为由架构和数据决定的固定常数。我们提供证据表明,α\alpha 随优化器而系统性变化。在受控的随机特征回归实验中——这是神经比例的标准理论框架——我们测量了五种优化器变体和六种谱条件下的 α\alpha。预条件化优化器 consistently 获得更陡峭的比例(更大的 α\alpha),且在大多数测试谱范围内的 α\alpha-偏移均呈现增加,峰值出现在 s=1.5s = 1.5,并在 s=2.0s = 2.0 保持较大值。在 s1.0s \approx 1.0(自然语言特征值)时,完全自然梯度实现的 α0.31\alpha \approx 0.31 相对于梯度下降的 α0.12\alpha \approx 0.12 多出 2.6×2.6\times 的拟合指数,该指数在随机特征模型中会随每个模型规模的加倍而叠加。是否及如何将这一指数偏移传递到大规模 LLM 训练中——最近的证据表明优势可能随规模而衰减——仍是一个重要的开放问题。我们的结果表明,比例定律预测应考虑优化器选择,我们提供一种谱诊断,用于预测何时会获益于高级优化器。

关键词

引用

@article{arxiv.2605.29387,
  title  = {On the Optimizer Dependence of Neural Scaling Laws},
  author = {Vansh Ramani and Shourya Vir Jain},
  journal= {arXiv preprint arXiv:2605.29387},
  year   = {2026}
}