面向理解基于梯度的元学习中的泛化
机器学习
2019-07-18 v1 计算机视觉与模式识别
机器学习
摘要
本工作通过分析目标景观的各种性质,研究基于梯度的元学习中神经网络的泛化。我们实验表明,随着元训练推进,通过对模型的元训练解在新任务上经几步基于梯度的微调自适应而得到的元测试解,变得更平坦、损失更低、且离元训练解更远。我们还表明,即便泛化开始退化,那些元测试解也变得更平坦,从而提供了在基于梯度的元学习范式下泛化与平坦极小之间相关性不成立实验证据。此外,我们提供经验证据:对新任务的泛化与它们在参数空间中自适应轨迹的相干性相关,该相干性由从同一元训练解出发的任务特定轨迹方向间的平均余弦相似度度量。我们还表明,由在元训练解处评估的任务特定梯度向量间的平均内积度量的元测试梯度相干性,也与泛化相关。基于这些观察,我们为 MAML 提出一种新正则化器,并提供了其有效性的实验证据。
引用
@article{arxiv.1907.07287,
title = {Towards Understanding Generalization in Gradient-Based Meta-Learning},
author = {Simon Guiroy and Vikas Verma and Christopher Pal},
journal= {arXiv preprint arXiv:1907.07287},
year = {2019}
}