Beta-调度:来自临界阻尼的动量作为神经网络训练的诊断与纠正工具
机器学习
2026-04-07 v2 人工智能
摘要
标准神经网络训练使用恒定动量(通常为 0.9),这一惯例可追溯至 1964 年,仅有有限的理论依据支持其最优性。我们从临界阻尼振荡器推导出时间可变动量方案:mu(t) = 1 - 2*sqrt(alpha(t)),其中 alpha(t) 为当前学习率。该 beta-调度方案仅需学习率计划之外的零自由参数。在 ResNet-18/CIFAR-10 上,beta-调度相较于恒定动量实现 1.9 倍更快的收敛速度,以 90% 准确率为目标。更重要的是,该方案下的分层梯度归因产生一种跨优化器不变的诊断工具:无论模型是使用 SGD 还是 Adam 训练,都可识别出相同的三个问题层(100% 重叠)。仅对这些层进行手术式纠正即可纠正 62 个误分类,同时仅重新训练 18% 的参数。一种混合调度——快速早期收敛使用物理动量,然后进行最终细化使用恒定动量——在五种方法中最快达到 95% 准确率。本文的主要贡献并非准确率提升,而是为局部化和纠正训练网络中的特定失效模式提供一个原则且无参数的工具。
引用
@article{arxiv.2603.28921,
title = {Beta-Scheduling: Momentum from Critical Damping as a Diagnostic and Correction Tool for Neural Network Training},
author = {Ivan Pasichnyk},
journal= {arXiv preprint arXiv:2603.28921},
year = {2026}
}
备注
18 pages, 3 figures, 5 tables. Code available on Kaggle, v2: Corrected author attribution for Karoni et al. (2026) reference