中文

通过对齐小批量改进 SGD 训练

机器学习 2020-02-28 v2 机器学习

摘要

用于监督学习的深度神经网络(DNN)可视为特征提取器(即最后隐藏层)与线性分类器(即输出层)的流水线,二者通过随机梯度下降(SGD)联合训练。在 SGD 的每次迭代中,从训练数据中采样一个小批量,并将损失函数的真实梯度估计为该小批量上计算得到的带噪梯度。从特征学习的角度看,特征提取器应更新以学习关于整体数据的有意义特征,并减少对小批量中噪声的迁就。基于此动机,我们提出训练中分布匹配(ITDM)以改进 DNN 训练并减轻过拟合。具体而言,除损失函数外,ITDM 通过在 SGD 每次迭代中匹配不同小批量分布的矩来正则化特征提取器,这通过最小化最大均值差异实现。因此,ITDM 不假设潜特征空间中数据分布的任何显式参数形式。我们进行了大量实验以证明所提策略的有效性。

关键词

引用

@article{arxiv.2002.09917,
  title  = {Improve SGD Training via Aligning Mini-batches},
  author = {Xiangrui Li and Deng Pan and Xin Li and Dongxiao Zhu},
  journal= {arXiv preprint arXiv:2002.09917},
  year   = {2020}
}