基于梯度的模型无关元学习算法的收敛理论
机器学习
2020-05-19 v4 最优化与控制
机器学习
摘要
我们研究一类基于梯度的模型无关元学习(MAML)方法的收敛性,并在非凸损失函数下以梯度范数刻画其总体复杂度及可达最佳精度。我们从 MAML 方法及其一阶近似(FO-MAML)出发,指出其分析中浮现的挑战。克服这些挑战后,我们不仅给出了 MAML 与 FO-MAML 在非凸设定下的首批理论保证,也回答了这些算法实现中一些未决问题,包括如何为对应任务的任务与数据集选择学习率和批大小。具体而言,我们证明 MAML 可在至多 次迭代后以需二阶信息为代价找到任意正数 的 -一阶平稳点(-FOSP)。我们还证明忽略 MAML 更新所需二阶信息的 FO-MAML 无法达到任意小的期望精度,即 FO-MAML 无法为任何 找到 -FOSP。我们进一步提出称为无 Hessian MAML 的 MAML 新变体,其在无需二阶信息访问的情况下保留 MAML 的全部理论保证。
引用
@article{arxiv.1908.10400,
title = {On the Convergence Theory of Gradient-Based Model-Agnostic Meta-Learning Algorithms},
author = {Alireza Fallah and Aryan Mokhtari and Asuman Ozdaglar},
journal= {arXiv preprint arXiv:1908.10400},
year = {2020}
}
备注
To appear in the proceedings of the $23^{rd}$ International Conference on Artificial Intelligence and Statistics (AISTATS) 2020