中文

事后经验回放加速近端策略优化

机器学习 2024-10-31 v1

摘要

事后经验回放(HER)通过将回合的目标事后修改为回合中达到的某个状态,加速了在发出稀疏奖励的环境中的异策略强化学习算法。由于对观测到目标的事后修改违反了同策略算法的假设,HER 通常不应用于同策略算法。在此,我们展示了当在自定义的捕食者-猎物环境中进行测试时,HER 可以显著加速近端策略优化(PPO)这一同策略强化学习算法。

关键词

引用

@article{arxiv.2410.22524,
  title  = {Hindsight Experience Replay Accelerates Proximal Policy Optimization},
  author = {Douglas C. Crowder and Darrien M. McKenzie and Matthew L. Trappett and Frances S. Chance},
  journal= {arXiv preprint arXiv:2410.22524},
  year   = {2024}
}

备注

12 pages. 10 Figures