中文

基于梯度对齐奖励的环内元学习

机器学习 2021-02-08 v1

摘要

标准深度学习训练循环的核心是一个最小化给定损失的贪婪梯度步。我们提出增加第二步以最大化训练泛化能力。为此,我们优化下一步训练的 loss。虽然计算此梯度通常非常昂贵,且许多有趣的应用考虑不可微参数(例如由于困难样本),我们提出了一种计算代价低且省内存的奖励,即梯度对齐奖励(GAR),可指导优化。我们利用该奖励在模型训练期间优化多个分布。首先,我们展示GAR在小型设置下选择作为多个数据集划分混合的数据分布的应用。其次,我们表明它可成功引导学习在CIFAR-10和CIFAR-100上与最先进(state-of-the-art)增强策略竞争的增强策略。

关键词

引用

@article{arxiv.2102.03275,
  title  = {In-Loop Meta-Learning with Gradient-Alignment Reward},
  author = {Samuel Müller and André Biedenkapp and Frank Hutter},
  journal= {arXiv preprint arXiv:2102.03275},
  year   = {2021}
}

备注

Accepted to Meta Learning Workshop at AAAI