大步长梯度下降用于非齐次双层网络:边际改进与快速优化
机器学习
2024-06-28 v2 机器学习
最优化与控制
摘要
使用 logistic loss 对神经网络进行大步长梯度下降(GD)训练通常涉及两个 distinct 阶段,其中在第一个阶段经验风险振荡,而在第二个阶段经验风险单调下降。我们研究了满足近似齐次条件的双层网络中的这一现象。我们表明,第二个阶段在经验风险下降到特定阈值(取决于步长)之后开始。此外,我们表明归一化边际在第二个阶段几乎单调增长,展示了 GD 在训练非齐次预测器中的隐式偏置。若数据集是线性可分的且激活函数的导数远离零,我们表明平均经验风险下降,暗示第一个阶段必须在有限步数内停止。最后,我们展示,通过选择合适的大步长,经历阶段转换的 GD 比单调降低风险的 GD 更高效。我们的分析适用于任意宽度的网络,超越已知的神经张量核和均值场范畴。
引用
@article{arxiv.2406.08654,
title = {Large Stepsize Gradient Descent for Non-Homogeneous Two-Layer Networks: Margin Improvement and Fast Optimization},
author = {Yuhang Cai and Jingfeng Wu and Song Mei and Michael Lindsey and Peter L. Bartlett},
journal= {arXiv preprint arXiv:2406.08654},
year = {2024}
}
备注
Clarify our results on sigmoid neural networks