中文

归一化保方向 Adam

机器学习 2018-09-19 v2 机器学习

摘要

自适应优化算法,如 Adam 和 RMSprop,已在某些场景中展现出比随机梯度下降(SGD)更好的优化性能。然而,最近的研究表明,它们常导致比 SGD 更差的泛化性能,尤其是在训练深度神经网络(DNNs)时。在本工作中,我们指出了 Adam 泛化差于 SGD 的原因,并开发了 Adam 的一个变体以消除泛化差距。所提出的方法,归一化保方向 Adam(ND-Adam),能够更精确地控制更新权重向量的方向和步长,从而显著改善泛化性能。遵循类似原理,我们通过正则化 softmax logits 进一步提升了分类任务中的泛化性能。通过弥合 SGD 与 Adam 之间的差距,我们也希望阐明为何某些优化算法比其他算法泛化更好。

关键词

引用

@article{arxiv.1709.04546,
  title  = {Normalized Direction-preserving Adam},
  author = {Zijun Zhang and Lin Ma and Zongpeng Li and Chuan Wu},
  journal= {arXiv preprint arXiv:1709.04546},
  year   = {2018}
}