遵循法则随流而行:梯度流的守恒律
机器学习
2024-07-11 v2 最优化与控制
摘要
理解梯度下降动力学的几何性质是解读近期极大规模机器学习模型成功的关键要素。一个引人注目的观察是,训练过的过参数化模型保留了优化初始化的一些性质。这种“隐式偏置”被认为对训练模型的一些良好性质负责,并可能解释其良好的泛化性质。本文的目的有三方面。首先,我们严格阐述“守恒律”的定义与基本性质,其定义了在给定模型(例如具有给定架构的ReLU网络)的梯度流中,无论任何训练数据和任何损失都守恒的量。然后我们解释如何通过对模型雅可比生成的李代数进行有限维代数操作,找到独立守恒律的最大数目。最后,我们提供算法以:a)计算一族多项式律;b)计算(未必是多项式的)独立守恒律的最大数目。我们提供了理论上完全推导的示例。此外,应用这两种算法对若干ReLU网络架构确认了所有已知律均被算法恢复,且不存在其他独立律。此类计算工具为理解大规模机器学习模型中优化初始化的理想性质铺平了道路。
引用
@article{arxiv.2307.00144,
title = {Abide by the Law and Follow the Flow: Conservation Laws for Gradient Flows},
author = {Sibylle Marcotte and Rémi Gribonval and Gabriel Peyré},
journal= {arXiv preprint arXiv:2307.00144},
year = {2024}
}