中文

用于目标条件强化学习的后见期望最大化

机器学习 2021-03-01 v2 机器学习

摘要

我们为目标条件强化学习(RL)提出了一个图模型框架,并采用在 RL 目标下界上运行的 EM 算法。E 步为“后见之明”学习技术(如 HER)如何处理极其稀疏的目标条件奖励提供了自然的解释。M 步将策略优化简化为监督学习更新,这极大地稳定了在高维输入(如图像)上的端到端训练。我们表明,组合算法 hEM 在具有稀疏奖励的广泛目标条件基准测试中,显著优于无模型基线。

关键词

引用

@article{arxiv.2006.07549,
  title  = {Hindsight Expectation Maximization for Goal-conditioned Reinforcement Learning},
  author = {Yunhao Tang and Alp Kucukelbir},
  journal= {arXiv preprint arXiv:2006.07549},
  year   = {2021}
}

备注

Accepted at International Conference on Artificial Intelligence and Statistics (AISTATS), 2021