中文

ICLR可复现性挑战报告(Padam:缩小训练深度神经网络中自适应梯度方法的泛化差距)

机器学习 2019-01-29 v1 机器学习

摘要

本工作是ICLR可复现性挑战2019的一部分,我们尝试复现会议投稿PADAM: Closing The Generalization Gap of Adaptive Gradient Methods In Training Deep Neural Networks中的结果。以往提出的自适应梯度方法展现出比带动量的随机梯度下降(SGD)更差的泛化性能。作者试图通过设计一种新的优化算法来解决此问题,该算法缩小了自适应梯度算法与带动量SGD之间的差距。该方法引入了称为部分自适应参数p的新可调超参数,其取值范围在[0, 0.5]之间。我们构建了所提出的优化器,并用其复现作者进行的实验。我们回顾并评论了作者所做的实证分析。最后,我们还提出了进一步研究Padam的未来方向。我们的代码见:https://github.com/yashkant/Padam-Tensorflow

关键词

引用

@article{arxiv.1901.09517,
  title  = {ICLR Reproducibility Challenge Report (Padam : Closing The Generalization Gap Of Adaptive Gradient Methods in Training Deep Neural Networks)},
  author = {Harshal Mittal and Kartikey Pandey and Yash Kant},
  journal= {arXiv preprint arXiv:1901.09517},
  year   = {2019}
}

备注

ICLR Reproducibility Challenge 2019 Report for Padam (11 pages, 30 figures)