大语言模型预训练中的有限大小梯度传输:从级联大小到强化传输效率
机器学习
2026-05-06 v1 无序系统与神经网络
人工智能
适应与自组织系统
摘要
我们提出一种用于实际语言模型训练的有限大小梯度传输框架,基于五个可观测量 用于区分级联大小、持续时间、绝对传输与强化传输效率。我们分析了来自Pico-LM的直接原始梯度测量,涵盖四个规模和125个对齐步骤,以及基于153个对齐检查点差分更新场构建的五规模Pythia数据集。两种家族在代数闭合性方面均相同,且均共享接近单位的级联大小主干,但占据不同的传输体系:Pico-LM显示正的持续时间比例与负的强化效率比例,而Pythia保持接近 基准,仅呈现弱正的效率比例依赖。随机场控制在强化与持续时间通道中几乎匹配的空底,表明该对比反映的是不同对共同空底的真实离散,而非不同空底的校准。两种家族在步骤幂律压缩性方面也有所不同:Pico-LM保留干净的持续时间与效率幂律,而Pythia保留大小主干但在这些通道中显示较弱的单斜率压缩性。外部性能关联亦按通道级别呈现,主要由 和归一化级联持续时间携带,而 作为共享大小主干,却无显著的指数级性能关联。这些结果支持一个可重复使用的传输测量框架,同时不主张普遍固定点或神经尺度定律的首因素推导。
引用
@article{arxiv.2605.02968,
title = {Finite-Size Gradient Transport in Large Language Model Pretraining: From Cascade Size to Intensive Transport Efficiency},
author = {Ping Wang and Yan-Qi Du},
journal= {arXiv preprint arXiv:2605.02968},
year = {2026}
}