中文

深度学习丰富机制训练的实证研究

机器学习 2021-03-01 v1 机器学习

摘要

尽管在理解惰性训练方面取得了进展,最近的研究将深度学习的实际成功归因于具有复杂归纳偏置的丰富机制。在本文中,我们通过基准数据集对丰富机制训练进行了实证研究,发现虽然大多数参数是惰性的,但总有一小部分活跃参数在训练过程中变化相当大。我们表明,重新初始化(重置为其初始随机值)这些活跃参数会导致更差的泛化能力。此外,我们发现大多数活跃参数位于靠近输入的底层,尤其是随着网络变宽时。基于这些观察,我们研究了静态逐层稀疏(LWS)SGD,它仅更新某些层的子集。我们发现仅更新顶层和底层具有良好泛化能力,并且正如预期的那样,仅更新顶层产生了一种快速算法。受此启发,我们研究了概率性 LWS-SGD,它主要更新顶层并偶尔更新整个网络。我们表明概率性 LWS-SGD 与原始 SGD 的泛化性能相匹配,并且反向传播时间可提高效率 2-5 倍。

关键词

引用

@article{arxiv.2102.13522,
  title  = {Experiments with Rich Regime Training for Deep Learning},
  author = {Xinyan Li and Arindam Banerjee},
  journal= {arXiv preprint arXiv:2102.13522},
  year   = {2021}
}