中文

广义数据分布迭代

机器学习 2022-06-22 v4 人工智能 神经与进化计算

摘要

同时获得更高的采样效率和更优的最终性能一直是深度强化学习(DRL)的主要挑战之一。先前的工作可以应对其中一项挑战,但通常无法同时解决。在本文中,我们试图同时应对这两个挑战。为此,我们首先将这些挑战解耦为两个经典的 RL 问题:数据丰富度与探索-利用权衡。然后,我们将这两个问题转化为训练数据分布优化问题,即在有限交互内获得所需的训练数据,并通过 i) 对行为策略的容量和多样性进行显式建模与控制,以及 ii) 使用单调数据分布优化对行为策略的选择/采样分布进行更细粒度和自适应的控制,来同时解决它们。最后,我们将该过程集成到广义策略迭代(GPI)中,得到了一个称为广义数据分布迭代(GDI)的更通用框架。我们利用 GDI 框架引入了从 DQN 到 Agent57 的知名 RL 方法的基于算子的版本。得出了 GDI 相较于 GPI 具有优越性的理论保证。我们还在 Arcade Learning Environment(ALE)上展示了最先进(SOTA)的性能,其中我们的算法仅使用 200M 训练帧就实现了 9620.33% 的平均人类归一化得分(HNS)、1146.39% 的中位 HNS,并超越了 22 项人类世界纪录。我们的性能与 Agent57 相当,而数据消耗仅为其 1/500。我们认为,在 ALE 中获得真正的超人类智能体仍有很长的路要走。

关键词

引用

@article{arxiv.2206.03192,
  title  = {Generalized Data Distribution Iteration},
  author = {Jiajun Fan and Changnan Xiao},
  journal= {arXiv preprint arXiv:2206.03192},
  year   = {2022}
}

备注

82 pages. This article is an extended work of arXiv:2112.04145 and arXiv:2106.06232. This article draws heavily from arXiv:2112.04145 and arXiv:2106.06232. We hope that adding some of the views from arXiv:2112.04145 and arXiv:2106.06232 into the appendix could greatly improve the readability