中文

置信时方信模型:基于掩码模型的 Actor-Critic

机器学习 2020-10-13 v1

摘要

一种普遍的看法是基于模型的强化学习(RL)比无模型 RL 具有更高的样本效率,但在实践中,由于被高估的模型误差,这并不总是成立。在复杂且噪声较大的环境中,基于模型的 RL 若不知何时该信任模型,往往难以利用模型。在这项工作中,我们发现更好的模型使用方式可以带来巨大差异。我们从理论上证明,如果将模型生成数据的使用限制在模型误差较小的状态-动作对上,则模型 rollout 与真实 rollout 之间的性能差距可以缩小。这促使我们仅在模型对其预测有信心时才使用模型 rollout。我们提出掩码基于模型的 Actor-Critic(M2AC),一种新颖的策略优化算法,可最大化真实价值函数的基于模型的下界。M2AC 实现了基于模型不确定性来决定是否使用其预测的掩码机制。因此,新算法趋向于给出稳健的策略改进。在连续控制基准上的实验表明,即使在噪声非常大的环境中使用长模型 rollout,M2AC 也具有强劲性能,并且显著优于先前的最先进方法。

关键词

引用

@article{arxiv.2010.04893,
  title  = {Trust the Model When It Is Confident: Masked Model-based Actor-Critic},
  author = {Feiyang Pan and Jia He and Dandan Tu and Qing He},
  journal= {arXiv preprint arXiv:2010.04893},
  year   = {2020}
}

备注

NeurIPS 2020