中文

无限宽神经网络中的特征学习

机器学习 2022-07-18 v3 无序系统与神经网络 神经与进化计算

摘要

当宽度趋于无穷时,若参数化得当(例如 NTK 参数化),深度神经网络在梯度下降下的行为会变得简化且可预测(例如由神经切线核(Neural Tangent Kernel, NTK)给出)。然而,我们表明神经网络的标准参数化和 NTK 参数化都不允许能够学习特征的无限宽极限,而特征学习对于诸如 BERT 的预训练和迁移学习至关重要。我们提出对标准参数化的简单修改,以在极限中允许特征学习。利用*张量程序(Tensor Programs)*技术,我们推导了此类极限的显式公式。在 Word2Vec 和通过 MAML 在 Omniglot 上的少样本学习这两个关键依赖特征学习的典型任务上,我们精确计算了这些极限。我们发现它们优于 NTK 基线和有限宽网络,后者随着宽度增加趋近于无限宽特征学习性能。更一般地,我们分类了一个自然神经网络参数化空间,它推广了标准、NTK 和平均场参数化。我们证明:1)该空间中的任何参数化要么允许特征学习,要么具有由核梯度下降给出的无限宽训练动态,但不能兼有;2)任何此类无限宽极限都可使用张量程序技术计算。我们的实验代码可在 github.com/edwardjhu/TP4 找到。

关键词

引用

@article{arxiv.2011.14522,
  title  = {Feature Learning in Infinite-Width Neural Networks},
  author = {Greg Yang and Edward J. Hu},
  journal= {arXiv preprint arXiv:2011.14522},
  year   = {2022}
}

备注

4th paper in the Tensor Programs series. Appearing in ICML 2021