中文

论 OpenAI 进化策略与随机梯度下降的关系

神经与进化计算 2017-12-19 v1

摘要

由于随机梯度下降(SGD)在优化百万参数神经网络方面展现出前景,且已知几乎无替代方案,它已居于领先强化学习(RL)方法的核心。因此,OpenAI 近期显示某种进化策略(ES)能以大型神经网络媲美基于 SGD 的深度 RL 方法性能的结果令人惊讶。该结果难以解释,部分因为 ES 与 SGD 实际关系的长期模糊。本文旨在通过一系列为揭示二者关系而设计的基于 MNIST 的实验显著减少此模糊。作为一个无领域噪声的简单监督问题(不同于大多数 RL),MNIST 使得(1) 测量 ES 与 SGD 计算的梯度间相关性,以及(2) 随后开发能准确预测不同 ES 种群大小性能的基于 SGD 的代理成为可能。这些创新对 ES 的真实能力提供了新层次的洞察,并引出一些将 ES 应用于监督问题的非传统手段,进一步阐明其与 SGD 的差异。结合这些经验,本文结尾证明 ES 能在 MNIST 上达到 99% 准确率,高于任何先前发表的进化方法结果。虽绝不意味着 ES 应在监督学习中替代 SGD,本文实验套件能在 RL 及其他范式中应用 ES 时支持更明智的决策。

关键词

引用

@article{arxiv.1712.06564,
  title  = {On the Relationship Between the OpenAI Evolution Strategy and Stochastic Gradient Descent},
  author = {Xingwen Zhang and Jeff Clune and Kenneth O. Stanley},
  journal= {arXiv preprint arXiv:1712.06564},
  year   = {2017}
}