中文

面向长期信用分配的合成回报

机器学习 2021-02-25 v1

摘要

自强化学习最早时期起,跨时间对动作进行信用分配的主力方法一直是时序差分(TD)学习,其逐时间步向后传播信用。当动作与奖励之间延迟较长、且中间无关事件给长期回报带来方差时,该方法表现不佳。我们提出状态关联(SA)学习,其中智能体学习状态与任意遥远未来奖励之间的关联,然后直接在两者间传播信用。本工作中,我们利用 SA 学习建模过去状态对当前奖励的贡献。借助该模型,我们可以预测每个状态对遥远未来的贡献,称此量为“合成回报”。随后可应用 TD 学习来选择最大化这些合成回报(SRs)的动作。我们展示了在一系列 TD 学习单独失效的任务上,为智能体增补 SRs 的有效性。我们表明所学得的 SRs 是可解释的:它们在关键动作被执行后的状态处出现尖峰。最后,我们展示了基于 IMPALA 的 SR 智能体解决了 Atari Skiing——一款具有长奖励延迟、对深度 RL 智能体构成重大障碍的游戏——其速度比已发表的最优方法快 25 倍。

关键词

引用

@article{arxiv.2102.12425,
  title  = {Synthetic Returns for Long-Term Credit Assignment},
  author = {David Raposo and Sam Ritter and Adam Santoro and Greg Wayne and Theophane Weber and Matt Botvinick and Hado van Hasselt and Francis Song},
  journal= {arXiv preprint arXiv:2102.12425},
  year   = {2021}
}