AACHER:结合后见之明经验回放的多样式行动者-评论家深度强化学习
机器人学
2022-10-25 v1 机器学习
摘要
行动者学习与评论家学习是杰出且最常用的深度确定性策略梯度(DDPG)强化学习方法的两个组成部分。由于行动者与评论家学习在整个机器人学习中起着重要作用,DDPG 方法的性能因此相对敏感且不稳定。我们提出一种多行动者-评论家 DDPG,以实现可靠的行动者-评论家学习,进一步增强 DDPG 的性能与稳定性。该多行动者-评论家 DDPG 随后与后见之明经验回放(HER)相整合,形成我们称为 AACHER 的新深度学习框架。AACHER 使用多个行动者或评论家的平均值来替代 DDPG 中的单一行动者或评论家,以在某一行动者或评论家表现不佳时增加鲁棒性。众多独立的行动者与评论家也能更广泛地从环境中获取知识。我们在基于目标的环境中实现了所提出的 AACHER:AuboReach、FetchReach-v1、FetchPush-v1、FetchSlide-v1 与 FetchPickAndPlace-v1。在实验中,我们采用了多种行动者/评论家组合实例,其中 A10C10 与 A20C20 是表现最佳的组合。总体结果表明,在所有用于评估的行动者/评论家数量组合中,AACHER 均优于传统算法(DDPG+HER)。当用于 FetchPickAndPlace-v1 时,A20C20 的性能提升高达 DDPG+HER 成功率的约 3.8 倍。
引用
@article{arxiv.2210.12892,
title = {AACHER: Assorted Actor-Critic Deep Reinforcement Learning with Hindsight Experience Replay},
author = {Adarsh Sehgal and Muskan Sehgal and Hung Manh La},
journal= {arXiv preprint arXiv:2210.12892},
year = {2022}
}