中文

EOC 处的 MLPs:NTK 的集中现象

机器学习 2025-01-27 v1 机器学习

摘要

我们研究在参数 θΘ\theta \in \Theta 初始化于 Edge Of Chaos (EOC) 处的 ll 层多层感知器 (MLP) N:Rm0×ΘRmlN : \mathbb{R}^{m_0} \times \Theta \to \mathbb{R}^{m_l} 的神经张量核 (NTK) Kθ:Rm0×Rm0Rml×mlK_\theta : \mathbb{R}^{m_0} \times \mathbb{R}^{m_0} \to \mathbb{R}^{m_l \times m_l} 的集中情况。这些 MLP 采用激活函数 ϕ(s)=as+bs\phi(s) = a s + b \vert s \vert,其中 a,bRa,b \in \mathbb{R}。在不依赖仅在无限宽极限下才成立的梯度独立假设的前提下,我们证明了在有限宽度下近似梯度独立性成立。通过最大不等式同时证明 NTK 条目 Kθ(xi1,xi2)K_\theta(x_{i_1},x_{i_2}) 对数据集 {x1,,xn}Rm0\{x_1,\cdots,x_n\} \subset \mathbb{R}^{m_0} 中的所有 i1,i2[1:n]i_1,i_2 \in [1:n] 的集中,我们证明了 NTK 矩阵 K(θ)=[1nKθ(xi1,xi2):i1,i2[1:n]]Rnml×nmlK(\theta) = [\frac{1}{n} K_\theta(x_{i_1},x_{i_2}) : i_1,i_2 \in [1:n]] \in \mathbb{R}^{nm_l \times nm_l} 在无限宽极限 KRnml×nml\overset{\scriptscriptstyle\infty}{K} \in \mathbb{R}^{nm_l \times nm_l} 附近集中,而无需线性超参数化。我们的结果表明,为了准确逼近极限,隐藏层宽度必须以 mk=k2mm_k = k^2 m 的形式以二次方式增长,其中 mN+1m \in \mathbb{N}+1。对于此类 MLP,我们获得集中界 P(K(θ)KO((Δϕ2+ml12l)κϕ2m12))1O(m1)\mathbb{P}( \| K(\theta) - \overset{\scriptscriptstyle\infty}{K} \| \leq O((\Delta_\phi^{-2} + m_l^{\frac{1}{2}} l) \kappa_\phi^2 m^{-\frac{1}{2}})) \geq 1-O(m^{-1}),其中我们记 Δϕ=b2a2+b2\Delta_\phi = \frac{b^2}{a^2+b^2}κϕ=a+ba2+b2\kappa_\phi = \frac{|a| + |b|}{\sqrt{a^2 + b^2}}。这表明绝对值函数 (Δϕ=1\Delta_\phi=1, κϕ=1\kappa_\phi=1) 在 NTK 集中方面优于 ReLU (Δϕ=12\Delta_\phi=\frac{1}{2}, κϕ=2\kappa_\phi=\sqrt{2})。

关键词

引用

@article{arxiv.2501.14724,
  title  = {MLPs at the EOC: Concentration of the NTK},
  author = {Dávid Terjék and Diego González-Sánchez},
  journal= {arXiv preprint arXiv:2501.14724},
  year   = {2025}
}

备注

36 pages, 1 figure