中文

广义宽度网络中尖锐特征学习转变与贝叶斯最优神经网络扩展定律

机器学习 2026-05-13 v1 无序系统与神经网络 统计力学 信息论 机器学习 math.IT

摘要

我们研究在高维 regime 下学习一个单隐藏层教师网络的信噪比极限问题,其中教师宽度 k 与输入维数 d 成线性比例,这一设置最近才变得可从理论上分析。我们采用一种启发式的 leave-one-out 解耦论证方法,该方法在数值上得到验证,推导出贝叶斯最优泛化误差和 individual 特征重叠的渐近尖锐表征。这些方程揭示了特征可学习性由一系列尖锐相位转变所支配:随着数据增长,教师特征依次可被恢复,每通过一次 discontinuous 的重叠跳跃。这种顺序获取过程形成了一种精确的概念,即 effective width k_c —— 在给定数据预算 n 的情况下可学习的特征数量——该概念统一了两种不同的扩展 regime:一种特征学习 regime,其中贝叶斯最优泛化误差 ε^{BO} 按 n^{1/(2β)-1} 扩展;以及一种精炼 regime,其中按 n^{-1} 扩展,其中 β>1/2 为幂律特征层级的指数。两种定律均折叠为单个关系 ε^{BO}=Θ(k_c d/n)。我们进一步通过实验表明,使用 \textsc{Adam} 在 effective width k_c 附近训练的学生模型可实现这些最优扩展定律(虽有小的算法差距),并提供了相关扩展模型大小的信息论解释。

关键词

引用

@article{arxiv.2605.10395,
  title  = {Sharp feature-learning transitions and Bayes-optimal neural scaling laws in extensive-width networks},
  author = {Minh-Toan Nguyen and Jean Barbier},
  journal= {arXiv preprint arXiv:2605.10395},
  year   = {2026}
}