中文

FiDi-RL: 结合深度强化学习与有限差分策略搜索以高效学习连续控制

机器学习 2020-02-04 v3 人工智能 机器学习

摘要

近年来,强化学习在处理具有挑战性的问题上取得了重大进展。尽管取得了巨大成功,强化学习在连续控制任务中仍面临挑战。传统方法总是以高昂的计算资源代价计算最优目标的导数,在处理此类任务时效率低下、不稳定且缺乏鲁棒性。另一种选择是,基于导数的方法将优化过程视为黑盒,在学习连续控制任务时表现出鲁棒性和稳定性,但在学习过程中数据效率不高。将两种方法结合起来以兼取两者之长引起了关注。然而,现有的多数结合工作采用复杂的神经网络(NNs)作为控制策略。深度神经网络这把双刃剑可以带来更好的性能,但也使得参数调优和计算变得困难。为此,本文提出了一种名为 FiDi-RL 的新方法,将深度强化学习与有限差分(FiDi)策略搜索相结合。FiDi-RL 将深度确定性策略梯度(DDPG)与增强随机搜索(ARS)相结合,旨在提高 ARS 的数据效率。实验结果表明,FiDi-RL 能够提升 ARS 的性能和稳定性,并且与一些现有的深度强化学习方法相比取得了有竞争力的结果。

关键词

引用

@article{arxiv.1907.00526,
  title  = {FiDi-RL: Incorporating Deep Reinforcement Learning with Finite-Difference Policy Search for Efficient Learning of Continuous Control},
  author = {Longxiang Shi and Shijian Li and Longbing Cao and Long Yang and Gang Zheng and Gang Pan},
  journal= {arXiv preprint arXiv:1907.00526},
  year   = {2020}
}

备注

I found some theoretical errors