CEM-RL:结合进化与基于梯度方法的策略搜索
机器学习
2019-02-12 v3 神经与进化计算
机器学习
摘要
深度神经进化与深度强化学习(deep RL)算法是两种流行的策略搜索方法。前者适用广泛且相当稳定,但样本效率低下。相比之下,后者样本效率更高,但样本效率最高的变体也相当不稳定且对超参数设置高度敏感。迄今为止,这两类方法多被作为竞争性工具进行比较。然而,一种新兴思路是将它们结合以兼得二者之长。两种既有结合方案分别使用了特定的进化算法或目标探索过程,配合样本高效的离策略深度RL算法深度确定性策略梯度(DDPG)。本文提出一种不同的结合方案,使用简单交叉熵方法(CEM)与双延迟深度确定性策略梯度(td3)——一种优于ddpg的离策略深度RL算法。我们在深度RL中经典使用的基准集上评估所得方法cem-rl。我们表明cem-rl相较竞争对手具有若干优势,并在性能与样本效率间提供了令人满意的权衡。
引用
@article{arxiv.1810.01222,
title = {CEM-RL: Combining evolutionary and gradient-based methods for policy search},
author = {Aloïs Pourchot and Olivier Sigaud},
journal= {arXiv preprint arXiv:1810.01222},
year = {2019}
}
备注
accepted at ICLR 2019