MHER:基于模型的回顾经验回放
机器学习
2021-11-30 v2 人工智能
机器人学
摘要
解决具有稀疏奖励的多目标强化学习(RL)问题通常具有挑战性。现有方法利用对收集经验的目標重标来缓解稀疏奖励引发的问题。然而,这些方法在效率上仍受限,且无法充分利用经验。本文提出基于模型的回顾经验回放(MHER),通过利用环境动力学生成虚拟达成目标来更高效地使用经验。用经训练动力学模型交互产生的虚拟目标替换原始目标,形成了一种新颖的重标方法——基于模型的重标(MBR)。基于MBR,MHER同时执行强化学习与监督学习以实现高效策略改进。理论上,我们亦证明MHER中的监督部分(即使用MBR数据的目标条件监督学习)优化多目标RL目标的一个下界。在若干基于点的任务与模拟机器人环境中的实验结果表明,MHER比先前的无模型与基于模型多目标方法实现了显著更高的样本效率。
引用
@article{arxiv.2107.00306,
title = {MHER: Model-based Hindsight Experience Replay},
author = {Rui Yang and Meng Fang and Lei Han and Yali Du and Feng Luo and Xiu Li},
journal= {arXiv preprint arXiv:2107.00306},
year = {2021}
}
备注
NeurIPS 2021 Workshop DeepRL