中文

学习峰值分布中的通用三分之一时间尺度

机器学习 2026-02-04 v1 人工智能 机器学习

摘要

训练大型语言模型(LLM)计算成本高昂,部分原因是损失函数呈现缓慢的幂律收敛,其起源仍有争议。通过对 toy 模型的系统性分析和对 LLM 的实证评估,我们展示这种行为可源自 softmax 和交叉熵的固有属性。在学习峰值概率分布(例如下一个词分布)时,这些组件会产生幂律消失的损失和梯度,造成根本性的优化瓶颈。最终导致损失对时间的幂律比例为 1/3 的普适指数。我们的结果提供了观察到神经网络尺度效应的机制性解释,并指明了提高 LLM 训练效率的新方向。

关键词

引用

@article{arxiv.2602.03685,
  title  = {Universal One-third Time Scaling in Learning Peaked Distributions},
  author = {Yizhou Liu and Ziming Liu and Cengiz Pehlevan and Jeff Gore},
  journal= {arXiv preprint arXiv:2602.03685},
  year   = {2026}
}

备注

24 pages, 6 main text figures, 27 figures in total