跨实验回放:离策略强化学习的自然扩展
机器学习
2023-11-29 v2 人工智能
机器人学
摘要
回放数据是离策略强化学习(RL)稳定性和数据效率的核心机制。我们提出了一个有效且简单的框架,将回放的使用扩展到多个实验中,对 RL 工作流做最小适配,即可在控制器性能和研究迭代时间上获得可观改进。其核心思想“跨实验回放”(RaE)涉及重用先前实验的经验以改善探索并引导学习,同时与已有工作相比将所需改动降至最低。我们通过经验展示了其在多种 RL 算法及涵盖运动与操控的困难控制领域(包括以自我中心视觉为主的困难探索任务)中的收益。通过全面的消融实验,我们证明了其对可用数据质量与数量以及各种超参数选择的鲁棒性。最后,我们讨论了该方法如何更广泛地应用于研究生命周期,并可通过跨随机种子或超参数变化重载数据来提升鲁棒性。
引用
@article{arxiv.2311.15951,
title = {Replay across Experiments: A Natural Extension of Off-Policy RL},
author = {Dhruva Tirumala and Thomas Lampe and Jose Enrique Chen and Tuomas Haarnoja and Sandy Huang and Guy Lever and Ben Moran and Tim Hertweck and Leonard Hasenclever and Martin Riedmiller and Nicolas Heess and Markus Wulfmeier},
journal= {arXiv preprint arXiv:2311.15951},
year = {2023}
}