通过参数化激活对 DDPG 智能体进行精细化连续控制
机器学习
2020-06-05 v1 人工智能
摘要
本文中,我们提出通过参数化产生动作的最终智能体层来增强 actor-critic 强化学习智能体,以适应不同执行器在与环境交互时在不同负载条件下的行为差异。我们提出将智能体中产生动作的层分支,以学习控制激活层(如 Tanh 和 Sigmoid)的调优参数。所学参数随后用于为每个执行器创建定制的激活函数。我们在三个 OpenAI Gym 环境(即 Pendulum-v0、LunarLanderContinuous-v2 和 BipedalWalker-v2)上运行了实验。结果显示,LunarLanderContinuous-v2 和 BipedalWalker-v2 环境的总回合奖励分别平均提升了 23.15% 和 33.80%。Pendulum-v0 环境无显著改进,但所提方法相比最先进方法产生了更稳定的驱动信号。所提方法使强化学习智能体能够产生更鲁棒的动作,以适应执行器响应函数的差异。这对于执行器因负载及与环境交互而呈现不同响应函数的真实场景尤为有用。这也通过微调参数化激活层而非每次更换执行器时重训整个策略,简化了迁移学习问题。最后,所提方法可更好地适应生物力学系统中的生物执行器(如肌肉)。
引用
@article{arxiv.2006.02818,
title = {Refined Continuous Control of DDPG Actors via Parametrised Activation},
author = {Mohammed Hossny and Julie Iskander and Mohammed Attia and Khaled Saleh},
journal= {arXiv preprint arXiv:2006.02818},
year = {2020}
}
备注
9 pages, 7 figures, 2 tables, submitted to Elsevier. This manuscript version is made available under the CC-BY-NC-ND 4.0 license http://creativecommons.org/licenses/by- nc-nd/4.0/