基于梯度对齐奖励的环内元学习
机器学习
2021-02-08 v1
摘要
标准深度学习训练循环的核心是一个最小化给定损失的贪婪梯度步。我们提出增加第二步以最大化训练泛化能力。为此,我们优化下一步训练的 loss。虽然计算此梯度通常非常昂贵,且许多有趣的应用考虑不可微参数(例如由于困难样本),我们提出了一种计算代价低且省内存的奖励,即梯度对齐奖励(GAR),可指导优化。我们利用该奖励在模型训练期间优化多个分布。首先,我们展示GAR在小型设置下选择作为多个数据集划分混合的数据分布的应用。其次,我们表明它可成功引导学习在CIFAR-10和CIFAR-100上与最先进(state-of-the-art)增强策略竞争的增强策略。
引用
@article{arxiv.2102.03275,
title = {In-Loop Meta-Learning with Gradient-Alignment Reward},
author = {Samuel Müller and André Biedenkapp and Frank Hutter},
journal= {arXiv preprint arXiv:2102.03275},
year = {2021}
}
备注
Accepted to Meta Learning Workshop at AAAI