中文

深度强化学习发现内部模型

人工智能 2016-06-17 v1

摘要

深度强化学习 (DRL) 是一个热门研究领域,在玩 Atari、解围棋和控制机器人等具有挑战性的问题中展现出巨大潜力。尽管 DRL 智能体在实践中表现良好,我们仍然缺乏分析其性能的工具。在本研究中,我们提出了半聚合 MDP (SAMDP) 模型。该模型最适合描述同时展现空间和时间层次结构的策略。我们描述了它与其他建模方法相比在分析已训练策略方面的优势,并表明在正确的状态表示下(如 DQN 智能体的状态表示),SAMDP 可以帮助识别技能。我们详细介绍了从记录的轨迹自动创建它的过程,直至在 t-SNE 地图上呈现它。我们解释了如何评估其拟合度,并展示了令人惊讶的结果,表明其与当前策略具有高度兼容性。最后,我们展示了如何使用 SAMDP 模型从智能体中挤出额外的性能提升。

关键词

引用

@article{arxiv.1606.05174,
  title  = {Deep Reinforcement Learning Discovers Internal Models},
  author = {Nir Baram and Tom Zahavy and Shie Mannor},
  journal= {arXiv preprint arXiv:1606.05174},
  year   = {2016}
}