中文

面向深度强化学习的感知-预测-反应智能体

人工智能 2020-06-30 v1 机器学习

摘要

我们提出了一种新的循环智能体架构及相关的辅助损失,以改进在需要长期记忆的部分可观测任务中的强化学习。我们采用时间层级结构,使用一个慢速循环的核使信息更容易在长时间跨度上流动,以及三个快速循环的核,其连接设计用于产生信息不对称性。反应核将新观测与慢速核的输入结合以产生智能体的策略;感知核仅访问短期观测并告知慢速核;最后,预测核仅访问长期记忆。一个辅助损失对所有三个核导出的策略进行相互正则化,体现了策略应能从近期或长期记忆中表达的先验。我们提出了所得的感知-预测-反应(Perception-Prediction-Reaction, PPR)智能体,并证明其在 DMLab-30 中相较强力的 LSTM 智能体基线取得了性能提升,尤其在需要长期记忆的任务中。我们进一步展示了在 Capture the Flag 这一需要智能体在长时间尺度上习得复杂混合技能的环境中的显著改进。在一系列消融实验中,我们探究了 PPR 智能体各组件的重要性,确定这一新颖的完整组合对于该引人注目的结果是必要的。

关键词

引用

@article{arxiv.2006.15223,
  title  = {Perception-Prediction-Reaction Agents for Deep Reinforcement Learning},
  author = {Adam Stooke and Valentin Dalibard and Siddhant M. Jayakumar and Wojciech M. Czarnecki and Max Jaderberg},
  journal= {arXiv preprint arXiv:2006.15223},
  year   = {2020}
}