一种融合进化与基于梯度的策略搜索的高效异步方法
机器学习
2021-04-06 v2 人工智能
摘要
深度强化学习(DRL)算法与进化策略(ES)已应用于多种任务,展现出优异性能。二者性质相反:DRL样本效率高但稳定性差,而ES则相反。近来已有将这两类算法结合的尝试,但这些方法完全依赖同步更新方案,难以理想地最大化ES并行性的优势。为解决此挑战,引入了异步更新方案,其具备良好的时间效率与多样的策略探索能力。本文提出异步进化策略-强化学习(AES-RL),最大化ES的并行效率并将其与策略梯度方法融合。具体而言,我们提出1)一种异步融合ES与DRL的新框架,以及2)多种异步更新方法,可同时发挥异步、ES与DRL各自的优势,即探索与时间效率、稳定性及样本效率。所提框架与更新方法在连续控制基准任务上进行了评估,相较先前方法展现出更优性能及时间效率。
引用
@article{arxiv.2012.05417,
title = {An Efficient Asynchronous Method for Integrating Evolutionary and Gradient-based Policy Search},
author = {Kyunghyun Lee and Byeong-Uk Lee and Ukcheol Shin and In So Kweon},
journal= {arXiv preprint arXiv:2012.05417},
year = {2021}
}