中文

MLPGradientFlow:随多层感知机之流而行(快速且精确地寻找极小点)

机器学习 2023-01-26 v1

摘要

MLPGradientFlow 是一个数值求解梯度流微分方程 θ˙=L(θ;D)\dot \theta = -\nabla \mathcal L(\theta; \mathcal D) 的软件包,其中 θ\theta 为多层感知机的参数,D\mathcal D 为某数据集,L\nabla \mathcal L 为损失函数的梯度。我们通过数值实验表明,基于 Runge-Kutta 格式的自适应一阶或高阶积分方法比使用 Adam 优化器的梯度下降具有更好的精度与收敛速度。然而,我们发现牛顿法及 BFGS 等近似方法更有利于高效且精确地寻找不动点(L\mathcal L 的局部与全局极小点)。对于小网络与小规模数据集,梯度计算通常快于 pytorch,且 Hessian 的计算至少快 5×5\times。此外,该包还配备了一个教师-学生配置的积分器,用于无限数据极限下以标准高斯输入训练的无偏双层网络。代码见 https://github.com/jbrea/MLPGradientFlow.jl。

关键词

引用

@article{arxiv.2301.10638,
  title  = {MLPGradientFlow: going with the flow of multilayer perceptrons (and finding minima fast and accurately)},
  author = {Johanni Brea and Flavio Martinelli and Berfin Şimşek and Wulfram Gerstner},
  journal= {arXiv preprint arXiv:2301.10638},
  year   = {2023}
}