中文

基于超梯度蒸馏的在线超参数元学习

机器学习 2022-02-15 v2

摘要

许多基于梯度的元学习方法假设存在一组不参与内部优化的参数,可视为超参数。尽管此类超参数可用现有基于梯度的超参数优化(HO)方法优化,但它们存在以下问题:展开微分方法难以扩展到高维超参数或长视野长度;基于隐函数定理(Implicit Function Theorem, IFT)的方法对在线优化有限制;而短视野近似存在短视野偏差。在本工作中,我们提出一种可克服这些限制的新型 HO 方法,通过知识蒸馏近似二阶项。具体而言,我们为每个 HO 步参数化一个雅可比-向量积(Jacobian-vector product, JVP)并最小化其与真实二阶项的距离。我们的方法支持在线优化,且可扩展到超参数维度和视野长度。我们在两种不同元学习方法和三个基准数据集上证明了方法的有效性。

关键词

引用

@article{arxiv.2110.02508,
  title  = {Online Hyperparameter Meta-Learning with Hypergradient Distillation},
  author = {Hae Beom Lee and Hayeon Lee and Jaewoong Shin and Eunho Yang and Timothy Hospedales and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2110.02508},
  year   = {2022}
}