中文

一种全局收敛的基于梯度的双层超参数优化方法

机器学习 2023-06-21 v2 最优化与控制

摘要

机器学习中的超参数优化通常借助朴素技术实现,仅能得到近似的超参数集合。尽管贝叶斯优化等方法在给定超参数域上进行智能搜索,但无法保证最优解。这类方法的主要缺陷在于其搜索域随超参数数量呈指数增长,增加了计算成本并导致速度缓慢。超参数优化问题本质上是一个双层优化任务,已有一些研究尝试用双层求解方法来解决该问题。然而,这些研究假设存在唯一一组使训练损失最小的模型权重,而深度学习架构通常不满足此假设。本文讨论一种基于梯度的双层方法,以解决这些缺陷并求解超参数优化问题。所提方法可处理连续超参数,我们在实验中选取了正则化超参数。该方法保证收敛到本研究在理论上证明的最优超参数集合。其思想是基于高斯过程回归近似下层最优值函数。由此,双层问题被归约为单层约束优化任务,并使用增广拉格朗日法求解。我们在 MNIST 与 CIFAR-10 数据集上基于多层感知机与 LeNet 架构进行了大量计算实验,证实了所提方法的有效性。针对多种超参数问题,与网格搜索、随机搜索、贝叶斯优化及 HyperBand 方法的对比研究表明,所提算法以更低计算量收敛,并得到在测试集上泛化能力更强的模型。

关键词

引用

@article{arxiv.2208.12118,
  title  = {A Globally Convergent Gradient-based Bilevel Hyperparameter Optimization Method},
  author = {Ankur Sinha and Satender Gunwal and Shivam Kumar},
  journal= {arXiv preprint arXiv:2208.12118},
  year   = {2023}
}