中文

深度 ReLU 分类的梯度下降通用性最优率

机器学习 2026-04-14 v3

摘要

近期进展显著性地提高了我们对梯度下降 (GD) 方法在深度神经网络中通用性的理解。一个自然且根本的问题是,GD 是否能够实现与在核设置中建立的最小混沌最优率相当的通用性率?现有结果要么产生次优的 O(1/n)O(1/\sqrt{n}) 率,要么聚焦于具有光滑激活函数的网络,导致对网络深度 LL 的指数依赖。在本文中,我们为使用深度 ReLU 网络的 GD 建立最优通用性率,通过仔细权衡优化误差和通用性误差,仅实现对深度的多项式依赖。具体而言,在假设数据来自于边际 γ\gamma 的可分离的 NTK 的情况下,我们证明了多余风险率为 O~(L6/(nγ2))\widetilde{O}(L^6 / (n \gamma^2)),这与最优 SVM 类型率 O~(1/(nγ2))\widetilde{O}(1 / (n \gamma^2)) 基本一致,仅在深度因子上有所不同。一个关键技术贡献是我们对参考模型附近激活模式的新颖控制,使我们能够为使用梯度下降训练的深度 ReLU 网络获得更精细的 Rademacher 复杂度界。

关键词

引用

@article{arxiv.2510.02779,
  title  = {Optimal Rates for Generalization of Gradient Descent for Deep ReLU Classification},
  author = {Yuanfan Li and Yunwen Lei and Zheng-Chu Guo and Yiming Ying},
  journal= {arXiv preprint arXiv:2510.02779},
  year   = {2026}
}

备注

Published in NeurIPS 2025