中文

基于梯度的模型无关元学习算法的收敛理论

机器学习 2020-05-19 v4 最优化与控制 机器学习

摘要

我们研究一类基于梯度的模型无关元学习(MAML)方法的收敛性,并在非凸损失函数下以梯度范数刻画其总体复杂度及可达最佳精度。我们从 MAML 方法及其一阶近似(FO-MAML)出发,指出其分析中浮现的挑战。克服这些挑战后,我们不仅给出了 MAML 与 FO-MAML 在非凸设定下的首批理论保证,也回答了这些算法实现中一些未决问题,包括如何为对应任务的任务与数据集选择学习率和批大小。具体而言,我们证明 MAML 可在至多 O(1/ϵ2)\mathcal{O}(1/\epsilon^2) 次迭代后以需二阶信息为代价找到任意正数 ϵ\epsilonϵ\epsilon-一阶平稳点(ϵ\epsilon-FOSP)。我们还证明忽略 MAML 更新所需二阶信息的 FO-MAML 无法达到任意小的期望精度,即 FO-MAML 无法为任何 ϵ>0\epsilon>0 找到 ϵ\epsilon-FOSP。我们进一步提出称为无 Hessian MAML 的 MAML 新变体,其在无需二阶信息访问的情况下保留 MAML 的全部理论保证。

关键词

引用

@article{arxiv.1908.10400,
  title  = {On the Convergence Theory of Gradient-Based Model-Agnostic Meta-Learning Algorithms},
  author = {Alireza Fallah and Aryan Mokhtari and Asuman Ozdaglar},
  journal= {arXiv preprint arXiv:1908.10400},
  year   = {2020}
}

备注

To appear in the proceedings of the $23^{rd}$ International Conference on Artificial Intelligence and Statistics (AISTATS) 2020