学习峰值分布中的通用三分之一时间尺度
机器学习
2026-02-04 v1 人工智能
机器学习
摘要
训练大型语言模型(LLM)计算成本高昂,部分原因是损失函数呈现缓慢的幂律收敛,其起源仍有争议。通过对 toy 模型的系统性分析和对 LLM 的实证评估,我们展示这种行为可源自 softmax 和交叉熵的固有属性。在学习峰值概率分布(例如下一个词分布)时,这些组件会产生幂律消失的损失和梯度,造成根本性的优化瓶颈。最终导致损失对时间的幂律比例为 1/3 的普适指数。我们的结果提供了观察到神经网络尺度效应的机制性解释,并指明了提高 LLM 训练效率的新方向。
引用
@article{arxiv.2602.03685,
title = {Universal One-third Time Scaling in Learning Peaked Distributions},
author = {Yizhou Liu and Ziming Liu and Cengiz Pehlevan and Jeff Gore},
journal= {arXiv preprint arXiv:2602.03685},
year = {2026}
}
备注
24 pages, 6 main text figures, 27 figures in total