中文

学习将动作值表示为动作顶点上的超图

机器学习 2021-06-22 v2 机器学习

摘要

动作值估计是许多强化学习(RL)方法的关键组成部分,其中样本复杂度在很大程度上取决于学习良好的动作值估计器的速度。通过表示学习的视角来看待这个问题,状态和动作的良好表示可以促进动作值估计。尽管深度学习的进步无缝地推动了状态表示学习的进展,但鉴于代理概念对 RL 的特异性,学习动作表示却鲜受关注。我们推测,利用多维动作空间的组合结构是学习良好动作表示的关键要素。为了验证这一点,我们提出了动作超图网络框架——一类在多维离散动作空间中学习动作表示并具有结构归纳偏置的函数。使用该框架,我们实现了一类与深度 Q 网络相结合的智能体,我们将其称为超图 Q 网络。我们在众多领域展示了我们方法的有效性:混淆效应最小的说明性预测问题、Atari 2600 游戏以及离散化物理控制基准。

关键词

引用

@article{arxiv.2010.14680,
  title  = {Learning to Represent Action Values as a Hypergraph on the Action Vertices},
  author = {Arash Tavakoli and Mehdi Fatemi and Petar Kormushev},
  journal= {arXiv preprint arXiv:2010.14680},
  year   = {2021}
}

备注

ICLR 2021, code: https://github.com/atavakol/action-hypergraph-networks