中文

识别逃离 NTK regime 的良好方向并高效学习低阶加稀疏多项式

机器学习 2022-11-29 v2 机器学习

摘要

深度学习理论近期的一个目标是确定神经网络如何逃离“懒惰训练”或神经切线核(NTK)regime,即网络在初始化处与其一阶泰勒展开相耦合。虽然 NTK 对学习稠密多项式是极小极大最优的(Ghorbani 等人,2021),但它无法学习特征,因此对包括稀疏多项式在内的许多函数类的样本复杂度较差。近期工作因而致力于确定基于梯度的算法可证明地比 NTK 泛化更好的设定。其中一个例子是 Bai 和 Lee(2020)的“QuadNTK”方法,其分析了泰勒展开中的二阶项。Bai 和 Lee(2020)表明二阶项可高效学习稀疏多项式;然而,它牺牲了学习一般稠密多项式的能力。本文中,我们利用 NTK 的谱刻画(Montanari 和 Zhong,2020)并基于 QuadNTK 方法,分析了两层神经网络上的梯度下降如何通过利用参数空间中的谱刻画逃离 NTK regime。我们首先扩展谱分析以识别参数空间中不损害泛化的“良好”方向。接着,我们证明宽两层神经网络可联合使用 NTK 与 QuadNTK 来拟合由稠密低阶项与稀疏高阶项组成的目标函数——这是 NTK 与 QuadNTK 各自都无法做到的。最后,我们构造一个正则化器以促使参数向量朝“良好”方向移动,并证明对正则化损失的梯度下降将收敛到全局极小元,且其测试误差也低。这给出了端到端的收敛与泛化保证,并在样本复杂度上相对 NTK 与 QuadNTK 单独使用均有可证明的改进。

关键词

引用

@article{arxiv.2206.03688,
  title  = {Identifying good directions to escape the NTK regime and efficiently learn low-degree plus sparse polynomials},
  author = {Eshaan Nichani and Yu Bai and Jason D. Lee},
  journal= {arXiv preprint arXiv:2206.03688},
  year   = {2022}
}

备注

v2: NeurIPS 2022 camera ready version