广义宽度网络中尖锐特征学习转变与贝叶斯最优神经网络扩展定律
机器学习
2026-05-13 v1 无序系统与神经网络
统计力学
信息论
机器学习
math.IT
摘要
我们研究在高维 regime 下学习一个单隐藏层教师网络的信噪比极限问题,其中教师宽度 k 与输入维数 d 成线性比例,这一设置最近才变得可从理论上分析。我们采用一种启发式的 leave-one-out 解耦论证方法,该方法在数值上得到验证,推导出贝叶斯最优泛化误差和 individual 特征重叠的渐近尖锐表征。这些方程揭示了特征可学习性由一系列尖锐相位转变所支配:随着数据增长,教师特征依次可被恢复,每通过一次 discontinuous 的重叠跳跃。这种顺序获取过程形成了一种精确的概念,即 effective width k_c —— 在给定数据预算 n 的情况下可学习的特征数量——该概念统一了两种不同的扩展 regime:一种特征学习 regime,其中贝叶斯最优泛化误差 ε^{BO} 按 n^{1/(2β)-1} 扩展;以及一种精炼 regime,其中按 n^{-1} 扩展,其中 β>1/2 为幂律特征层级的指数。两种定律均折叠为单个关系 ε^{BO}=Θ(k_c d/n)。我们进一步通过实验表明,使用 \textsc{Adam} 在 effective width k_c 附近训练的学生模型可实现这些最优扩展定律(虽有小的算法差距),并提供了相关扩展模型大小的信息论解释。
引用
@article{arxiv.2605.10395,
title = {Sharp feature-learning transitions and Bayes-optimal neural scaling laws in extensive-width networks},
author = {Minh-Toan Nguyen and Jean Barbier},
journal= {arXiv preprint arXiv:2605.10395},
year = {2026}
}