中文

用于强化学习的可交换输入表示

机器学习 2020-03-23 v1 人工智能 机器学习

摘要

样本效率低是深度强化学习在许多领域中的主要局限。本工作提出一种基于注意力的方法,将神经网络输入投影到一个对输入顺序变化保持不变的高效表示空间。我们展示了对于 mm 个对象的输入,我们所提出的表示 resulting in an input space that is a factor of m!m! smaller。我们还展示了我们的方法能够表示具有可变数量对象的输入。我们的实验证明了在多种任务上策略梯度方法的样本效率提升。我们表明我们的表示使我们能够解决在使用朴素方法时 otherwise intractable 的问题。

关键词

引用

@article{arxiv.2003.09022,
  title  = {Exchangeable Input Representations for Reinforcement Learning},
  author = {John Mern and Dorsa Sadigh and Mykel J. Kochenderfer},
  journal= {arXiv preprint arXiv:2003.09022},
  year   = {2020}
}

备注

6 pages, 7 figures