以 200 倍更快速度达到人类水平的 Atari
机器学习
2022-09-19 v1
摘要
构建在广泛任务上表现良好的通用智能体一直是强化学习自诞生以来的重要目标。该问题已成为大量研究的主题,其性能常通过观测 Atari 57 基准中包含的广泛环境上的得分来衡量。Agent57 是首个在所有 57 个游戏上超越人类基准的智能体,但代价是数据效率低下,需要近 800 亿帧经验才能实现。以 Agent57 为起点,我们采用多样化策略以实现超越人类基线所需经验的 200 倍缩减。我们研究了在缩减数据规模时遇到的若干不稳定性与瓶颈,并提出有效方案以构建更鲁棒且高效的智能体。我们也展示了与 Muesli 和 MuZero 等高性能方法的竞争力。我们方法的四个关键组成部分为:(1)一种近似信赖域方法,其实现从在线网络的稳定自举;(2)一种针对损失与优先级的归一化方案,提升学习具有广尺度值域的值函数集合时的鲁棒性;(3)一种采用 NFNets 技术以利用更深网络且无需归一化层的改进架构;(4)一种策略蒸馏方法,用于随时间平滑瞬时贪婪策略。
引用
@article{arxiv.2209.07550,
title = {Human-level Atari 200x faster},
author = {Steven Kapturowski and Víctor Campos and Ray Jiang and Nemanja Rakićević and Hado van Hasselt and Charles Blundell and Adrià Puigdomènech Badia},
journal= {arXiv preprint arXiv:2209.07550},
year = {2022}
}