中文

GA+DDPG+HER:深度强化学习中基于遗传算法的函数优化器用于机器人操作任务

机器人学 2022-11-21 v2

摘要

智能体可基于强化学习(RL)所做的决策依赖于奖励函数。然而,学习算法参数取值的选择会对整体学习过程产生显著影响。为发现接近最优的学习参数取值,我们在本研究中扩展了先前提出的基于遗传算法的深度确定性策略梯度与后见经验回放方法(称为GA+DDPG+HER)。我们将GA+DDPG+HER方法应用于FetchReach、FetchSlide、FetchPush、FetchPick&Place与DoorOpening等机器人操作任务。我们的技术GA+DDPG+HER也以少量调整用于AuboReach环境。我们的实验分析表明,该方法产生的性能明显更优且比原始算法更快收敛。我们也提供证据表明GA+DDPG+HER击败了现有方法。最终结果支持我们的论断,并提供充分证明:自动化参数调优过程至关重要,且确实将学习时间缩短了多达57%。

关键词

引用

@article{arxiv.2203.00141,
  title  = {GA+DDPG+HER: Genetic Algorithm-Based Function Optimizer in Deep Reinforcement Learning for Robotic Manipulation Tasks},
  author = {Adarsh Sehgal and Nicholas Ward and Hung Manh La and Christos Papachristos and Sushil Louis},
  journal= {arXiv preprint arXiv:2203.00141},
  year   = {2022}
}

备注

This submission is replacement of: 2203.00141