中文

学习动力学:基于隐式常微分方程的生成式调度策略

机器学习 2025-09-30 v1

摘要

学习率调度是神经网络优化中最具影响力的方面之一,然而大多数调度策略要么遵循简单的参数函数,要么仅对短期训练信号做出反应。它们都没有得到关于神经网络实际训练效果如何的全面时序视角的支持。我们提出了一种新的学习率调度器,将神经网络的训练性能建模为一个动力系统。它利用超参数搜索中的训练运行数据来学习训练过程的隐式表示。给定当前的训练指标,它能预测出具有最佳长期验证性能的未来学习率调度。我们的调度器能够泛化到先前未见的训练动力学,并生成与常见参数函数显著不同的专用调度策略。在 CNN 和 ResNet 模型的图像分类以及 Transformer 模型的下一 token 预测任务中,它均取得了 SOTA 结果。训练得到的模型位于损失景观中更平坦的区域,因此相比使用其他调度策略训练的模型具有更好的泛化能力。我们的方法计算效率高,与优化器无关,并且可以轻松地叠加在机器学习实验跟踪平台之上。我们的调度器实现将在论文被接收后公开。

引用

@article{arxiv.2509.23052,
  title  = {Dynamics of Learning: Generative Schedules from Latent ODEs},
  author = {Matt L. Sampson and Peter Melchior},
  journal= {arXiv preprint arXiv:2509.23052},
  year   = {2025}
}

备注

9 pages, 5 figures, comments welcome