学习优化拟牛顿法
机器学习
2023-09-12 v2
摘要
快速的基于梯度的优化算法对于机器学习模型的计算高效训练已变得愈发重要。一种技术是将梯度乘以预条件矩阵以产生步长,但最佳预条件矩阵尚不清楚。本文介绍了一种称为 LODO 的新型机器学习优化器,它试图在优化过程中在线元学习最佳预条件矩阵。具体而言,我们的优化器将学习优化(L2O)技术与拟牛顿方法相融合,以学习参数化为神经网络的预条件矩阵;它们比其他拟牛顿方法中的预条件矩阵更灵活。与其他 L2O 方法不同,LODO 不需要在任何训练任务分布上进行元训练,而是在测试任务上优化时即时学习优化,在遍历损失地形时适应其局部特征。理论上,我们证明我们的优化器在含噪损失地形中近似逆 Hessian,并能够表示广泛的逆 Hessian。我们通过实验验证我们的算法能在含噪设置中优化,并表明表示逆 Hessian 的更简单替代方案会恶化性能。最后,我们使用我们的优化器以与标准神经网络优化器相当的速度训练一个具有 95k 参数的半真实深度神经网络。
引用
@article{arxiv.2210.06171,
title = {Learning to Optimize Quasi-Newton Methods},
author = {Isaac Liao and Rumen R. Dangovski and Jakob N. Foerster and Marin Soljačić},
journal= {arXiv preprint arXiv:2210.06171},
year = {2023}
}