中文

大语言模型预训练中的有限大小梯度传输:从级联大小到强化传输效率

机器学习 2026-05-06 v1 无序系统与神经网络 人工智能 适应与自组织系统

摘要

我们提出一种用于实际语言模型训练的有限大小梯度传输框架,基于五个可观测量 (D,z,β,δ,vrel)(D, z, \beta, \delta, v_{\mathrm{rel}}) 用于区分级联大小、持续时间、绝对传输与强化传输效率。我们分析了来自Pico-LM的直接原始梯度测量,涵盖四个规模和125个对齐步骤,以及基于153个对齐检查点差分更新场构建的五规模Pythia数据集。两种家族在代数闭合性方面均相同,且均共享接近单位的级联大小主干,但占据不同的传输体系:Pico-LM显示正的持续时间比例与负的强化效率比例,而Pythia保持接近 D=1D=1 基准,仅呈现弱正的效率比例依赖。随机场控制在强化与持续时间通道中几乎匹配的空底,表明该对比反映的是不同对共同空底的真实离散,而非不同空底的校准。两种家族在步骤幂律压缩性方面也有所不同:Pico-LM保留干净的持续时间与效率幂律,而Pythia保留大小主干但在这些通道中显示较弱的单斜率压缩性。外部性能关联亦按通道级别呈现,主要由 vrelv_{\mathrm{rel}} 和归一化级联持续时间携带,而 D(t)D(t) 作为共享大小主干,却无显著的指数级性能关联。这些结果支持一个可重复使用的传输测量框架,同时不主张普遍固定点或神经尺度定律的首因素推导。

关键词

引用

@article{arxiv.2605.02968,
  title  = {Finite-Size Gradient Transport in Large Language Model Pretraining: From Cascade Size to Intensive Transport Efficiency},
  author = {Ping Wang and Yan-Qi Du},
  journal= {arXiv preprint arXiv:2605.02968},
  year   = {2026}
}