用于目标条件强化学习的后见期望最大化
机器学习
2021-03-01 v2 机器学习
摘要
我们为目标条件强化学习(RL)提出了一个图模型框架,并采用在 RL 目标下界上运行的 EM 算法。E 步为“后见之明”学习技术(如 HER)如何处理极其稀疏的目标条件奖励提供了自然的解释。M 步将策略优化简化为监督学习更新,这极大地稳定了在高维输入(如图像)上的端到端训练。我们表明,组合算法 hEM 在具有稀疏奖励的广泛目标条件基准测试中,显著优于无模型基线。
引用
@article{arxiv.2006.07549,
title = {Hindsight Expectation Maximization for Goal-conditioned Reinforcement Learning},
author = {Yunhao Tang and Alp Kucukelbir},
journal= {arXiv preprint arXiv:2006.07549},
year = {2021}
}
备注
Accepted at International Conference on Artificial Intelligence and Statistics (AISTATS), 2021