中文

基于梯度方法中的固有噪声

机器学习 2020-05-27 v1 机器学习

摘要

先前的工作通过分析 GD 和 SGD 等基于梯度的算法,研究了容量更大的神经网络即使在没有显式正则化器的情况下也能比较小容量网络泛化更好的能力。噪声的存在及其对参数扰动鲁棒性的影响已被关联到泛化。我们考察了 GD 和 SGD 的一个性质,即 GD(和 SGD)不是遍历网络中所有的标量权重并逐一更新,而是同时更新所有参数。结果,每个参数 wiw^i 在陈旧参数 wt\mathbf{w_t} 处计算其偏导数,但随后承受损失 L^(wt+1)\hat{L}(\mathbf{w_{t+1}})。我们表明这会导致优化中引入噪声。我们发现该噪声会惩罚那些对权重扰动敏感的模型。我们发现对于当前正用于更新的批次,惩罚最为显著,且对更大的模型更高。

关键词

引用

@article{arxiv.2005.12743,
  title  = {Inherent Noise in Gradient Based Methods},
  author = {Arushi Gupta},
  journal= {arXiv preprint arXiv:2005.12743},
  year   = {2020}
}