中文

收集与推断——对数据高效强化学习的新审视

机器学习 2021-08-24 v1

摘要

本立场论文从数据效率的角度对强化学习(RL)提出了新的审视。数据高效的强化学习经历了三个主要阶段:纯在线强化学习,其中每个数据点仅被考虑一次;带有经验回放缓冲区的强化学习,其中对部分经验进行额外学习;以及最终基于转移记忆的强化学习,从概念上讲,所有转移都被存储并在每次更新步骤中重复使用。虽然从所有显式存储的经验中推断知识已带来了数据效率的巨大提升,但如何收集这些数据的问题却远未得到充分研究。我们认为,只有仔细考虑这两个方面,才能实现数据效率。我们建议通过一个我们称之为“收集与推断”的范式来明确这一见解,该范式将强化学习显式地建模为两个独立但相互关联的过程,分别关注数据收集和知识推断。我们讨论了该范式的含义、其思想如何在文献中体现,以及它如何指导未来数据高效强化学习的研究。

关键词

引用

@article{arxiv.2108.10273,
  title  = {Collect & Infer -- a fresh look at data-efficient Reinforcement Learning},
  author = {Martin Riedmiller and Jost Tobias Springenberg and Roland Hafner and Nicolas Heess},
  journal= {arXiv preprint arXiv:2108.10273},
  year   = {2021}
}