对角线性网络 SGD 的隐式偏置:随机性的可证明益处
机器学习
2021-12-08 v3
摘要
理解训练算法的隐式偏置对于解释过参数化神经网络的成功至关重要。本文通过其连续时间版本即随机梯度流,研究随机梯度下降在对角线性网络上的动力学。我们明确刻画了随机流所选择的解,并证明它总是比梯度流的解具有更好的泛化性质。颇为令人惊讶的是,我们表明训练损失的收敛速度控制着偏置效应的强度:收敛越慢,偏置越好。为完整我们的分析,我们给出了该动力学的收敛保证。我们也给出了支持理论断言的实验结果。我们的发现凸显了结构化噪声可诱导更好泛化这一事实,并有助于解释实践中观察到的随机梯度下降优于梯度下降的性能。
引用
@article{arxiv.2106.09524,
title = {Implicit Bias of SGD for Diagonal Linear Networks: a Provable Benefit of Stochasticity},
author = {Scott Pesme and Loucas Pillaud-Vivien and Nicolas Flammarion},
journal= {arXiv preprint arXiv:2106.09524},
year = {2021}
}