从亚线性到线性:通过局部多项式-洛亚维茨区域实现有限宽度网络的局部收敛
机器学习
2026-05-29 v3 机器学习
摘要
我们研究了在平方经验损失下,对有限宽度前馈网络进行梯度下降的局部线性收敛性。先前的工作表明,GD 能在初始化处的局部准凸区域(LQCR)内保持,但仅给出亚线性收敛率。我们证明,如果经验神经张量核在初始化时为正,稳定于 LQCR,且与 LQCR 半径相容,则平方损失满足局部多项式-洛亚维茨不等式,其常数为 。结合固定步长迭代在 LQCR 内的约束——即在线性收敛定理中假设——这导致该区域内实现线性收敛。LQCR 提供了局部化;固定步长约束是线性收敛定理中的假设;而 PL 不等式来自 NTK 在平方损失下的条件。该结果因此是充分的局部条件,不是该机制是快速收敛唯一或必要机制的论断。我们通过 NTK 谱隙、参数漂移、经验 PL 比率和次优性衰减来探索该理论。在二进制 MNIST 数据集上,NTK 保持为正,PL 比率具有正的下边界,损失在稳定区域显示几何衰减。在宽度消融实验中,步幅为 的运行离开了局部区域;减小步幅将最终漂移从 降至 ,恢复了观察到的局部区域诊断,并在研究中实现了最大的经验 PL 比率下边界。在 CNN 鲁棒性检查中,对 CIFAR-10 子集进行测试,PL 比率下边界在三个随机种子下均保持为正,在稳定区域内三个随机种子的所有结果都呈正的下边界。
引用
@article{arxiv.2507.21429,
title = {From Sublinear to Linear: Local Convergence in Finite-Width Networks via Locally Polyak-Lojasiewicz Regions},
author = {Agnideep Aich and Ashit Baran Aich and Bruce Wade},
journal= {arXiv preprint arXiv:2507.21429},
year = {2026}
}