Leap+Verify:用于加速神经网络训练的规模自适应投机权重预测
摘要
我们提出 Leap+Verify 框架,将投机执行——预测未来模型权重并在接受前验证预测——应用于加速神经网络训练。受语言模型推理中的投机解码和用于程序执行的 Automatically Scalable Computation (ASC) 架构启发,Leap+Verify 将训练分解为三个动态检测的规模(混乱、转换、稳定),使用激活空间余弦相似性作为实时 Lyapunov 代理信号。 在每个规模下,分析性权重预测器(动量、线性、二次外推)尝试预测模型参数 K 步 ahead;只有在验证通过 held-out 损失标准后才接受预测。我们在 GPT-2 124M 和 Qwen 2.5-1.5B 在 WikiText-103 上评估了 Leap+Verify,进行五次随机种子的预测深度 K 在 {5, 10, 25, 50, 75, 100} 的扫描。动量基于预测(Adam 动量外推)在两个规模下都会 catastrophic 失败,预测损失实际损失高出 100-10,000 倍——一种普遍的优化器状态外推的范数爆炸。有限差分预测器(线性、二次)在动量失败的地方成功:在 124M,他们在稳定规模下以 K=5 实现 24% 严格接受;在 1.5B,他们在转换规模下实现 37% 严格接受。规模相关发现在规模分布:GPT-2 124M 在稳定规模中花费 34%,而 Qwen 1.5B 在混乱规模中花费 64%,仅在 0-2 个 40 个检查点中达到稳定。更大的模型在可预测时更可预测,但更少可预测——实际瓶颈从预测器准确率转向规模可用性。跨种子结果高度一致(验证损失方差小于 1%),三个规模框架在种子间产生相同的相位边界(±50 步)。
关键词
引用
@article{arxiv.2602.19580,
title = {Leap+Verify: Regime-Adaptive Speculative Weight Prediction for Accelerating Neural Network Training},
author = {Jeremy McEntire},
journal= {arXiv preprint arXiv:2602.19580},
year = {2026}
}
备注
18 pages, 5 tables. Code and data available at https://github.com/jmcentire/leap-verify