元镜像下降:用于快速收敛的优化器学习
机器学习
2022-03-08 v1 最优化与控制
摘要
优化器是训练机器学习模型的关键组件,其设计影响学习速度与泛化能力。若干研究尝试通过求解一个双层优化问题来学习更有效的梯度下降优化器,该问题在优化器参数上最小化泛化误差。然而,多数现有优化器学习方法仅基于直观动机,缺乏清晰的理论支撑。我们采用不同于梯度下降的视角,从镜像下降出发,并对相应的 Bregman 散度进行元学习。在此范式下,我们形式化了一个最小化学习后悔界的新颖元学习目标。所得框架称为元镜像下降(MetaMD),可学习以加速优化速度。与许多元学习优化器不同,它同时支持收敛与泛化保证,且独特地无需验证数据即可做到。我们在多种任务与架构上就收敛率和泛化误差评估了我们的框架,并展示了强劲性能。
引用
@article{arxiv.2203.02711,
title = {Meta Mirror Descent: Optimiser Learning for Fast Convergence},
author = {Boyan Gao and Henry Gouk and Hae Beom Lee and Timothy M. Hospedales},
journal= {arXiv preprint arXiv:2203.02711},
year = {2022}
}