在稀疏奖励环境中利用演示数据增强元强化学习
机器学习
2022-09-28 v1 机器人学
摘要
元强化学习(Meta-RL)是一种将解决多种任务所获得的经验提炼为元策略的方法。该元策略仅需少量(甚至单步)适配,便能在新的相关任务上接近最优地执行。然而,将该方法应用于解决现实世界问题的一大挑战在于,这些问题常伴随稀疏奖励函数,仅指示任务是否部分或完全完成。我们考虑这样一种情形:每个任务都有一些数据可用,这些数据可能由次优智能体生成。随后,我们开发了一类称为利用演示增强元强化学习(EMRLD)的算法,其利用这些即便次优的信息在训练期间获取指导。我们展示了EMRLD如何联合利用RL与对离线数据的监督学习来生成具有单调性能提升的元策略。我们还开发了一种称为EMRLD-WS的热启动变体,其对次优演示数据尤为高效。最后,我们表明,在包括移动机器人在内的多种稀疏奖励环境中,我们的EMRLD算法显著优于现有方法。
引用
@article{arxiv.2209.13048,
title = {Enhanced Meta Reinforcement Learning using Demonstrations in Sparse Reward Environments},
author = {Desik Rengarajan and Sapana Chaudhary and Jaewon Kim and Dileep Kalathil and Srinivas Shakkottai},
journal= {arXiv preprint arXiv:2209.13048},
year = {2022}
}
备注
Accepted to NeurIPS 2022; first two authors contributed equally