中文

学习分解策略与动作价值函数:面向深度强化学习的因子化动作空间表示

机器学习 2017-05-23 v1 人工智能

摘要

深度强化学习(DRL)方法在越来越多的高维视觉决策领域中表现良好。在所有此类视觉决策问题中,具有离散动作空间的问题往往在所述动作空间中具有潜在的组合结构。此类动作空间通常包含诸如“向左走”、“向上走”以及“向左上方斜走”(即前两个动作的组合)等动作。传统上,对此类领域中的控制策略进行表示建模时,并未利用动作空间中这种固有的组合结构。我们提出一种新的学习范式——因子化动作空间表示(FAR),其中我们将使用深度强化学习算法学得的控制策略分解为独立分量,类似于将一个向量按一组正交基向量进行分解。这种控制策略表示的架构修改使得智能体能够在仅执行其中一个动作的同时,学习关于多个动作的信息。我们证明,FAR 在 Atari 2600 平台上对两种 DRL 算法带来了显著提升:FARA3C 在 14 项任务中的 9 项上优于 A3C(异步优势演员-评论家),FARAQL 在 13 项任务中的 9 项上优于 AQL(异步 n 步 Q 学习)。

关键词

引用

@article{arxiv.1705.07269,
  title  = {Learning to Factor Policies and Action-Value Functions: Factored Action Space Representations for Deep Reinforcement learning},
  author = {Sahil Sharma and Aravind Suresh and Rahul Ramesh and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:1705.07269},
  year   = {2017}
}

备注

11 pages + 7 pages appendix