利用方向性高斯平滑进化策略加速强化学习
机器学习
2020-02-24 v1 人工智能
最优化与控制
机器学习
摘要
进化策略(ES)已在许多具有挑战性的强化学习(RL)任务中展现出巨大潜力,可与其他最先进的深度 RL 方法相媲美。然而,当前 ES 实践中存在两个可能阻碍其进一步能力的局限。首先,大多数当前方法依赖蒙特卡洛型梯度估计器来给出搜索方向,其中策略参数通常是随机采样的。由于此类估计器精度较低,RL 训练可能收敛缓慢,并需要更多迭代才能到达最优解。其次,奖励函数的景观可能具有欺骗性并包含许多局部极大值,导致 ES 算法过早收敛,无法探索参数空间中其他可能具有更大奖励的部分。在本工作中,我们采用方向性高斯平滑进化策略(DGS-ES)来加速 RL 训练,该策略凭借其以下能力很好地应对这两个挑战:i) 提供高精度的梯度估计;ii) 寻找非局部搜索方向,其侧重于奖励函数的大尺度变化而忽略局部波动。通过此处展示的若干基准 RL 任务,我们表明 DGS-ES 具有高度可扩展性、拥有优越的挂钟时间,并取得了与其他流行策略梯度和 ES 方法相竞争的奖励分数。
引用
@article{arxiv.2002.09077,
title = {Accelerating Reinforcement Learning with a Directional-Gaussian-Smoothing Evolution Strategy},
author = {Jiaxing Zhang and Hoang Tran and Guannan Zhang},
journal= {arXiv preprint arXiv:2002.09077},
year = {2020}
}