中文

大语言模型训练动力学中的Mpemba效应:对谷-河模型的极小分析

人工智能 2025-07-08 v1

摘要

大语言模型(LLM)训练中的学习率(LR)调度通常遵循经验模板:预热、恒定平台/稳定阶段和衰减(WSD)。然而,这种策略的机理解释仍未得到充分探索,平台高度和衰减调度的选择在很大程度上是启发式的。在本文中,我们通过Mpemba效应(一种较热系统在淬入相同冷浴时比冷系统冷却得更快的现象)将训练动力学与热力学类比联系起来。我们分析了一类“谷-河”损失景观,其中尖锐的(谷)方向快速平衡,而较平坦的(河)方向控制全局下降。Mpemba效应为预热阶段的必要性提供了解释,并激励了高平台(而非低平台)以加速衰减期间的损失下降。我们证明,对于某些损失景观,存在一个最优平台学习率——“强Mpemba点”——在该点处最慢模式消失,从而在衰减阶段实现更快的收敛。我们推导了其存在的解析条件,并估计了保持Mpemba优势所需的衰减动力学。我们的极小模型和分析为基于平台的调度器提供了原则性证明,并为以最小超参数搜索调整LLM中的学习率提供了指导。

关键词

引用

@article{arxiv.2507.04206,
  title  = {Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model},
  author = {Sibei Liu and Zhijian Hu},
  journal= {arXiv preprint arXiv:2507.04206},
  year   = {2025}
}