双层优化的随机方法:用于超参数优化与元学习
机器学习
2024-10-15 v1 机器学习
摘要
我们解决的是现代深度学习中常见的可微元学习问题,包括超参数优化、损失函数学习、few-shot学习、不变性学习等。这些问题通常被形式化为双层优化 (BLO)。我们提出一种新颖的视角,将给定的 BLO 问题转化为随机优化,其中内层损失函数变为平滑概率分布,外层损失函数变为对内层分布的期望损失。为解决此随机优化,我们采用随机梯度 Langevin 动力学 (SGLD) MCMC 对内层分布进行采样,并提出一种循环算法来计算基于蒙特卡洛估计的超梯度。我们的推导类似于前向模式求导,但我们引入一种新的一阶近似,使其适用于大型模型,而无需存储巨大的雅可比矩阵。主要收益体现在两方面:i)我们的随机公式考虑了不确定性,这使得该方法对次优内优化或由于过参数化导致的非唯一多个内最小值具有鲁棒性;ii)与现有方法通常在实践中表现不稳定且对超参数敏感不同,我们的方法显著提高了解的可靠性。我们展示了该新方法在多样化的元学习问题上取得了有前景的结果,并且轻松扩展到在视觉 Transformer 中学习 8700 万个超参数。
引用
@article{arxiv.2410.10417,
title = {A Stochastic Approach to Bi-Level Optimization for Hyperparameter Optimization and Meta Learning},
author = {Minyoung Kim and Timothy M. Hospedales},
journal= {arXiv preprint arXiv:2410.10417},
year = {2024}
}