中文

神经网络在信息论极限附近学习通用多指数模型

机器学习 2026-02-06 v2 人工智能 信息论 机器学习 math.IT 统计理论 统计理论

摘要

在深度学习中,核心议题之一是理解神经网络如何高效学习高维特征。为此,我们探讨了使用梯度下降学习一般高斯多指数模型 f(x)=g(Ux)f(\boldsymbol{x})=g(\boldsymbol{U}\boldsymbol{x}),其中隐藏子空间为 URr×d\boldsymbol{U}\in \mathbb{R}^{r\times d},这 явля为研究表示学习的标准设置。我们证明,在链函数的通用非退化假设下,通过层级梯度下降训练的标准两层神经网络可在使用 O~(d)\widetilde{\mathcal{O}}(d) 个样本和 O~(d2)\widetilde{\mathcal{O}}(d^2) 时间内,以 od(1)o_d(1) 测试误差无偏学习目标。样本和时间复杂度均与信息论极限相符,仅上升阶数,因此是最优的。在梯度下降学习的初始阶段,证明通过表明内权重可以执行幂迭代过程来进行。该过程在整个隐藏子空间的整个张量上隐式模拟了光谱启动,并最终消除有限样本噪声并恢复该张量。这 surprisingly 表示,只有当第一层训练超过 O(1)\mathcal{O}(1) 步时,才能实现最优结果。该工作表明神经网络在样本和时间效率方面能够有效学习具有层次性的函数。

关键词

引用

@article{arxiv.2511.15120,
  title  = {Neural Networks Learn Generic Multi-Index Models Near Information-Theoretic Limit},
  author = {Bohan Zhang and Zihao Wang and Hengyu Fu and Jason D. Lee},
  journal= {arXiv preprint arXiv:2511.15120},
  year   = {2026}
}

备注

85 pages, 2 figures. The order of the first two authors was determined by a coin flip. Accepted by ICLR 2026