中文

用于大 Minibatch SGD 的对比权重正则化

机器学习 2020-11-19 v1 机器学习

摘要

小批量随机梯度下降方法(SGD)因其高效性和可扩展性被广泛应用于深度学习,使得能够利用海量数据训练深度网络。特别是在分布式环境中,SGD 通常采用大批量大小。然而,与小批量 SGD 相反,使用大批量 SGD 训练的神经网络模型难以很好地泛化,即验证准确率较低。在本工作中,我们引入了一种新颖的正则化技术,即差异化正则化(DReg),它复制深度网络的某一层并鼓励两层的参数保持多样性。DReg 技术引入的计算开销极小。此外,我们通过实验证明,使用 DReg 优化神经网络并结合大批量 SGD,在收敛性上实现了显著提升,并改善了泛化性能。我们还证明 DReg 能够加速带动量的大批量 SGD 的收敛。我们相信 DReg 可以作为一种简单的正则化技巧,以加速深度学习中的大批量训练。

关键词

引用

@article{arxiv.2011.08968,
  title  = {Contrastive Weight Regularization for Large Minibatch SGD},
  author = {Qiwei Yuan and Weizhe Hua and Yi Zhou and Cunxi Yu},
  journal= {arXiv preprint arXiv:2011.08968},
  year   = {2020}
}