基于随机梯度优化的信息论信赖域
机器学习
2023-11-01 v1
摘要
基于随机梯度的优化对于训练神经网络至关重要。虽然流行的方法通过重新缩放梯度来启发式地调整步长和方向,但改进优化器的一种更原则性方法需要二阶信息。此类方法利用目标函数的 Hessian 矩阵对梯度进行预条件处理。然而,计算 Hessian 矩阵通常代价高昂,并且在随机梯度设定下有效利用二阶信息并非易事。我们提出使用信息论信赖域优化(arTuRO)以在二阶信息不确定的情况下实现改进更新。通过将网络参数建模为高斯分布并使用基于 Kullback-Leibler 散度的信赖域,我们的方法在考虑目标函数曲率及参数不确定性的前提下采取有界步长。在每次更新前,它求解信赖域问题以获得最优步长,从而实现更稳定且更快速的优化过程。我们使用一种简单的递归最小二乘法从随机梯度中近似 Hessian 矩阵的对角元素,仅利用一阶信息随时间的推移构建期望 Hessian 的模型。我们表明 arTuRO 将基于自适应矩优化的快速收敛性与 SGD 的泛化能力相结合。
引用
@article{arxiv.2310.20574,
title = {Information-Theoretic Trust Regions for Stochastic Gradient-Based Optimization},
author = {Philipp Dahlinger and Philipp Becker and Maximilian Hüttenrauch and Gerhard Neumann},
journal= {arXiv preprint arXiv:2310.20574},
year = {2023}
}