投影梯度下降寻找低次数多项式的超参数神经网络:近似最小熵率
机器学习
2026-03-24 v1 机器学习
统计理论
统计理论
摘要
我们研究了在单位球面上定义的次数为 k0 = Θ(1) ≥ 1 的低次数球形多项式的学习问题,通过训练带增强特征的双层神经网络。我们的主要结果是显著改进的样本复杂度。我们表明,对于任何回归风险 ε ∈ (0, Θ(d^{-k0})],一个经过训练的超参数双层神经网络通过 novel 投影梯度下降 (GDP) 方法,需要的样本复杂度为 n ≍ Θ( log(4/δ) · d^{k0}/ε ),其中 δ ∈ (0,1) 为概率 1-δ;与代表性样本复杂度 Θ(d^{k0} max{ε^{-2}, log d}) 形成鲜明对比。此外,此类样本复杂度几乎不可改进,因为训练得到的网络实现了非参数回归风险的近似最优率,为 log(4/δ) · Θ(d^{k0}/n),概率至少为 1-δ。另一方面,具有秩为 Θ(d^{k0}) 的核的回归风险的最小熵率为 Θ(d^{k0}/n),因此,由 GDP 训练的网络的非参数回归风险几乎达到了最小熵率。当真实次数 k0 未知时,我们提出了一种新颖且可证明的自适应次数选择算法,该算法识别真实次数并实现相同的近似最优回归率。据我们所知,这是首次通过使用流行激活函数 (ReLU) 训练超参数神经网络并获得学习低次数球形多项式的近似最优风险界的工作。由于 GDP 的特征学习能力,这些结果超出了常规神经张量核 (NTK) 的极限。
引用
@article{arxiv.2603.21062,
title = {Gradient Descent with Projection Finds Over-Parameterized Neural Networks for Learning Low-Degree Polynomials with Nearly Minimax Optimal Rate},
author = {Yingzhen Yang and Ping Li},
journal= {arXiv preprint arXiv:2603.21062},
year = {2026}
}