Ctrl-Z:从强化学习的不稳定性中恢复
机器学习
2019-10-10 v1 机器人学
机器学习
摘要
在学习行为时,训练数据通常由学习器自身生成;这可能导致不稳定的训练动态,并且该问题在机器人等安全敏感的实时控制任务中有特别重要的应用。在本工作中,我们提出一种原则性且模型无关的方法,通过维护强化学习智能体在训练过程中的历史记录,并在性能显著下降时回退到先前智能体的参数,来缓解不稳定学习动态的问题。我们开发了通过统计假设检验持续改进来评估该性能的技术,并在涉及模拟机器人连续控制的标准且具有挑战性的基准任务套件上对其进行了评估。我们在性能和超参数鲁棒性方面展示了相对于最先进强化学习算法的改进,在 6 个评估环境中的 5 个中优于 DDPG,且与已知相对稳定的 TD3 相比性能无下降。通过这种方式,我们的方法朝着提高真实世界机器人应用训练中的数据效率和稳定性迈出了重要一步。
引用
@article{arxiv.1910.03732,
title = {Ctrl-Z: Recovering from Instability in Reinforcement Learning},
author = {Vibhavari Dasagi and Jake Bruce and Thierry Peynot and Jürgen Leitner},
journal= {arXiv preprint arXiv:1910.03732},
year = {2019}
}
备注
Submitted to ICRA2020, under review