中文

无模型强化学习中的反事实信用分配

机器学习 2021-12-15 v2

摘要

强化学习中的信用分配是衡量一个动作对未来奖励影响的问题。具体而言,这需要将技能与运气分离,即把一个动作对奖励的影响与外部因素及后续动作的影响解开。为此,我们将因果理论中的反事实概念适配到无模型 RL 设定中。其核心思想是通过学习从轨迹中提取相关信息,使价值函数以未来事件为条件。我们提出了一类策略梯度算法,使用这些未来条件价值函数作为基线或评论家,并证明它们在理论上具有低方差。为避免由以未来信息为条件带来的潜在偏差,我们约束后见信息不包含关于智能体动作的信息。我们在若干说明性与具挑战性的问题上展示了我们算法的有效性与正确性。

关键词

引用

@article{arxiv.2011.09464,
  title  = {Counterfactual Credit Assignment in Model-Free Reinforcement Learning},
  author = {Thomas Mesnard and Théophane Weber and Fabio Viola and Shantanu Thakoor and Alaa Saade and Anna Harutyunyan and Will Dabney and Tom Stepleton and Nicolas Heess and Arthur Guez and Éric Moulines and Marcus Hutter and Lars Buesing and Rémi Munos},
  journal= {arXiv preprint arXiv:2011.09464},
  year   = {2021}
}