中文

无黑塞双层级算法的收敛理论

机器学习 2022-06-07 v3 最优化与控制 机器学习

摘要

双层级优化已成为现代机器学习中的有力工具。然而,由于双层级优化的嵌套结构,即便是基于梯度的方法也需要通过 Jacobian 和/或 Hessian-向量乘积来近似二阶导数,这在实际应用中代价高昂且难以扩展。近来,无黑塞双层级方案被提出以解决该问题,其总体思路是利用零阶或一阶方法近似双层级问题的完整超梯度。然而,我们经实证观察到,此类近似会导致较大方差与不稳定训练,而仅估计响应 Jacobian 矩阵作为超梯度的部分分量却被证明极为有效。为此,我们提出一种新的无黑塞方法,采用类零阶方法通过对两条优化路径取差来近似响应 Jacobian 矩阵。在理论上,我们给出了所提算法的收敛速率分析,其中关键挑战在于刻画轨迹依赖估计器的近似与光滑性质,这一点本身具有独立意义。这是此类无黑塞双层级算法的首个已知收敛速率结果。在实验上,我们证明了所提算法在各类双层级问题上优于基线双层级优化器。特别是在使用 ResNet-12 网络在 miniImageNet 数据集上进行少样本元学习的实验中,我们表明我们的算法优于基线元学习算法,而其他基线双层级优化器在可比时间范围内无法求解此类元学习问题。

关键词

引用

@article{arxiv.2110.07004,
  title  = {On the Convergence Theory for Hessian-Free Bilevel Algorithms},
  author = {Daouda Sow and Kaiyi Ji and Yingbin Liang},
  journal= {arXiv preprint arXiv:2110.07004},
  year   = {2022}
}

备注

Submitted for publication