中文

将学习率衰减与权重衰减同复杂性梯度下降相结合——第一部分

机器学习 2019-02-11 v1 机器学习

摘要

L2L^2 正则化在深度神经网络这一特定情形(而非更传统的机器学习模型)中的作用仍未被完全阐明。我们假设这种复杂的相互作用源于过参数化与训练期间发生的高维现象的结合,使其难以适用标准凸优化方法。利用来自统计物理和随机场理论的见解,我们引入一个同时考虑损失函数水平及其剩余非凸性的参数:\emph{复杂性}。我们进而表明进行 \emph{复杂性梯度下降} 是可取的。然后我们展示如何利用这一直觉,在为深度神经网络执行标准随机梯度下降时,推导出针对 L2L^2 正则化强度的新颖且高效的退火方案。

关键词

引用

@article{arxiv.1902.02881,
  title  = {Combining learning rate decay and weight decay with complexity gradient descent - Part I},
  author = {Pierre H. Richemond and Yike Guo},
  journal= {arXiv preprint arXiv:1902.02881},
  year   = {2019}
}