更大、更好、更快:以人类水平的效率实现人类水平的 Atari 表现
机器学习
2023-11-14 v3 人工智能
摘要
我们引入一种基于价值的强化学习智能体,称之为 BBF,其在 Atari 100K 基准上取得了超人类表现。BBF 依赖于扩展用于价值估计的神经网络,以及若干以样本高效方式实现该扩展的其他设计选择。我们对这些设计选择进行了广泛分析,并为未来工作提供见解。最后我们讨论了更新 ALE 上样本高效 RL 研究的目标基准。我们在 https://github.com/google-research/google-research/tree/master/bigger_better_faster 公开了代码与数据。
引用
@article{arxiv.2305.19452,
title = {Bigger, Better, Faster: Human-level Atari with human-level efficiency},
author = {Max Schwarzer and Johan Obando-Ceron and Aaron Courville and Marc Bellemare and Rishabh Agarwal and Pablo Samuel Castro},
journal= {arXiv preprint arXiv:2305.19452},
year = {2023}
}
备注
ICML 2023, revised version