中文

预条件处理何时有助于或损害泛化?

机器学习 2020-12-10 v4 机器学习

摘要

尽管自然梯度下降(NGD)等二阶优化器常能加速优化,它们对泛化的影响却受到质疑。本文对一阶与二阶方法的隐式偏置如何影响泛化性质比较给出了更细致的视角。我们给出了在一般预条件矩阵P\boldsymbol{P}下过参数化无岭回归泛化误差的精确渐近偏置-方差分解,并将逆总体费雪信息矩阵(用于NGD)作为特例。我们确定了偏置与方差各自的最优P\boldsymbol{P},并发现不同优化器的相对泛化性能取决于标签噪声与信号(真实参数)的“形状”:当标签含噪、模型设定有误或信号与特征不对齐时,NGD可获得更低风险;反之,在干净标签、模型设定正确或信号对齐下,GD比NGD泛化更好。基于此分析,我们讨论若干管理偏置-方差权衡的方法,以及GD与NGD之间插值的潜在益处。随后我们将分析扩展到再生核希尔伯特空间中的回归,并证明预条件GD比GD更快降低总体风险。最后,我们在神经网络实验中实证比较了一阶与二阶优化器的泛化误差,观察到与理论分析稳健吻合的趋势。

关键词

引用

@article{arxiv.2006.10732,
  title  = {When Does Preconditioning Help or Hurt Generalization?},
  author = {Shun-ichi Amari and Jimmy Ba and Roger Grosse and Xuechen Li and Atsushi Nitanda and Taiji Suzuki and Denny Wu and Ji Xu},
  journal= {arXiv preprint arXiv:2006.10732},
  year   = {2020}
}

备注

42 pages