通过 UMDAc 在强化学习中演化神经网络
神经与进化计算
2019-04-25 v1 机器学习
摘要
由于大量成功解决的复杂基准问题,神经网络在强化学习领域正日益流行。事实上,人工智能算法在某些情况下能够超越人类专业人员。通常,神经网络具有不止几个隐藏层,因而涉及大量需要优化的参数。通常,使用数值方法来优化神经网络的内部参数,例如随机梯度下降。然而,这些技术往往计算上非常昂贵,而对于某些有效性至关重要的任务,高计算成本是不可接受的。沿着这些研究路线,本文我们提出通过分布估计算法来优化神经网络的参数。更确切地说,使用单变量边缘分布算法 (univariate marginal distribution algorithm) 在各种强化学习任务中演化神经网络。为验证我们的想法,我们在四个 OpenAI Gym 基准问题上运行所提算法。此外,将所得结果与标准遗传算法进行比较。结果表明,在大多数情况下,使用 UMDAc 优化比遗传算法提供更好的结果。
引用
@article{arxiv.1904.10932,
title = {Evolving Neural Networks in Reinforcement Learning by means of UMDAc},
author = {Mikel Malagon and Josu Ceberio},
journal= {arXiv preprint arXiv:1904.10932},
year = {2019}
}
备注
10 pages, 6 figures