HiER:高亮经验回放以提升离策略强化学习智能体
机器人学
2024-07-29 v3
摘要
尽管基于强化学习的算法在许多领域取得了超越人类的表现,但机器人领域仍面临重大挑战,因为状态和动作空间是连续的,且奖励函数主要是稀疏的。此外,在许多情况下,智能体无法获得任何形式的演示。受人类学习的启发,本文提出了一种名为高亮经验回放(HiER)的方法,该方法为最相关的经验创建一个辅助高亮回放缓冲区。在权重更新时,从标准经验回放缓冲区和高亮经验回放缓冲区中共同采样转换。该方法可以与后见经验回放(HER)和优先经验回放(PER)技术结合使用,也可以单独使用。我们的方法显著提升了现有技术的性能,并在三个机器人基准测试的8个任务上得到了验证。此外,为了充分发挥HiER的潜力,我们提出了HiER+,其中HiER通过任意数据收集课程学习方法得到增强。我们的实现、定性结果和视频演示可在项目网站获取:http://www.danielhorvath.eu/hier/。
引用
@article{arxiv.2312.09394,
title = {HiER: Highlight Experience Replay for Boosting Off-Policy Reinforcement Learning Agents},
author = {Dániel Horváth and Jesús Bujalance Martín and Ferenc Gábor Erdős and Zoltán Istenes and Fabien Moutarde},
journal= {arXiv preprint arXiv:2312.09394},
year = {2024}
}
备注
Published in IEEE Access