中文

核 regime 下深度网络在训练集外的谱偏置

机器学习 2022-10-18 v2 机器学习

摘要

我们提供了量化边界,度量在有限样本上训练的有限宽度网络轨迹与无限宽度、无限数据的理想核动力学之间在 function space 中的 L2L^2 差异。这些边界的一个推论是:网络偏向于学习神经切线核(Neural Tangent Kernel)的顶层本征函数,不仅是在训练集上,而是在整个输入空间上。该偏置仅取决于模型架构与输入分布,因此不依赖于目标函数,而目标函数无需处于该核的RKHS中。结果对具有全连接、卷积和残差层的深度架构均成立。此外,为获得截至某一停止时间的高概率边界,宽度无需随样本数多项式增长。证明利用了初始化时费雪信息矩阵(Fisher Information Matrix)的低有效秩性质,其意味着模型的低有效维度(远小于参数量)。我们得出结论:源自费雪信息矩阵低有效秩的局部容量控制,在理论上仍未被充分探索。

关键词

引用

@article{arxiv.2206.02927,
  title  = {Spectral Bias Outside the Training Set for Deep Networks in the Kernel Regime},
  author = {Benjamin Bowman and Guido Montufar},
  journal= {arXiv preprint arXiv:2206.02927},
  year   = {2022}
}

备注

38 pages, 1 figure, to be published in NeurIPS 2022