中文

4+3 神经计算最优规模定律

机器学习 2025-04-22 v3 机器学习 最优化与控制 概率论 统计理论 统计理论

摘要

我们考虑具有三个参数的数据复杂度、目标复杂度和模型参数数量的可求解神经规模模型。我们使用该神经规模模型推导有关 compute-limited、无限数据规模定律 regime 的新预测。为了训练神经规模模型,我们在均方误差损失上执行一次随机梯度下降。我们推导表示损失曲线的表示,该表示在所有迭代计数中都有效,并且随着模型参数数量的增加而提高准确性。随后,我们分析 compute-optimal 模型参数数量,并在数据复杂度/目标复杂度相位平面中识别出 4 个相位 (+3 子相位)。相位边界由模型容量、优化器噪声和特征嵌入的相对重要性决定。我们进一步推导,并结合数学证明和大量数值证据,计算出所有这些相位中的规模定律指数,特别是计算作为浮点运算预算函数的最优模型参数数量。

关键词

引用

@article{arxiv.2405.15074,
  title  = {4+3 Phases of Compute-Optimal Neural Scaling Laws},
  author = {Elliot Paquette and Courtney Paquette and Lechao Xiao and Jeffrey Pennington},
  journal= {arXiv preprint arXiv:2405.15074},
  year   = {2025}
}