FiDi-RL: 结合深度强化学习与有限差分策略搜索以高效学习连续控制
机器学习
2020-02-04 v3 人工智能
机器学习
摘要
近年来,强化学习在处理具有挑战性的问题上取得了重大进展。尽管取得了巨大成功,强化学习在连续控制任务中仍面临挑战。传统方法总是以高昂的计算资源代价计算最优目标的导数,在处理此类任务时效率低下、不稳定且缺乏鲁棒性。另一种选择是,基于导数的方法将优化过程视为黑盒,在学习连续控制任务时表现出鲁棒性和稳定性,但在学习过程中数据效率不高。将两种方法结合起来以兼取两者之长引起了关注。然而,现有的多数结合工作采用复杂的神经网络(NNs)作为控制策略。深度神经网络这把双刃剑可以带来更好的性能,但也使得参数调优和计算变得困难。为此,本文提出了一种名为 FiDi-RL 的新方法,将深度强化学习与有限差分(FiDi)策略搜索相结合。FiDi-RL 将深度确定性策略梯度(DDPG)与增强随机搜索(ARS)相结合,旨在提高 ARS 的数据效率。实验结果表明,FiDi-RL 能够提升 ARS 的性能和稳定性,并且与一些现有的深度强化学习方法相比取得了有竞争力的结果。
引用
@article{arxiv.1907.00526,
title = {FiDi-RL: Incorporating Deep Reinforcement Learning with Finite-Difference Policy Search for Efficient Learning of Continuous Control},
author = {Longxiang Shi and Shijian Li and Longbing Cao and Long Yang and Gang Zheng and Gang Pan},
journal= {arXiv preprint arXiv:1907.00526},
year = {2020}
}
备注
I found some theoretical errors