中文

面向强化学习的均匀状态抽象

机器学习 2020-04-08 v1 人工智能 机器学习

摘要

基于势的奖励塑形(Potential Based Reward Shaping)结合基于适当定义的抽象知识的势函数,已被证明能显著加快强化学习中的学习速度。多网格强化学习(MRL)进一步表明,此类以势函数形式存在的抽象知识几乎可以仅从智能体与环境的交互中学习得到。然而,我们指出 MRL 存在难以良好扩展至与深度学习协同工作的问题。本文对 MRL 进行扩展与改进,以利用深度 Q 网络(DQN)等现代深度学习算法。我们表明,采用我们所提方法增强的 DQN 在连续控制任务上的表现显著优于其原始版本以及采用 MRL 增强的 DQN。

关键词

引用

@article{arxiv.2004.02919,
  title  = {Uniform State Abstraction For Reinforcement Learning},
  author = {John Burden and Daniel Kudenko},
  journal= {arXiv preprint arXiv:2004.02919},
  year   = {2020}
}

备注

8 Pages, 2 figures, Accepted for publication in the European Conference of Artificial Intelligence (ECAI 2020)