基于自预测表示的数据高效强化学习
机器学习
2021-05-21 v4 机器学习
摘要
尽管深度强化学习在解决可以通过与环境进行无限交互来收集大量数据的任务方面表现出色,但从有限交互中学习仍然是一个关键挑战。我们假设,如果将奖励最大化与基于其视觉输入结构及与环境的序列交互的自监督目标相结合,智能体可以更高效地学习。我们的方法,自预测表示,训练智能体将其自身的潜在状态表示预测到未来的多个步骤。我们使用一个作为智能体参数指数移动平均的编码器来计算未来状态的目标表示,并使用一个学习到的转移模型进行预测。就其本身而言,该未来预测目标优于以往从像素进行样本高效的深度强化学习方法。我们通过在未来预测损失中加入数据增强来进一步提高性能,这迫使智能体的表示在观测的多个视角之间保持一致。我们结合了未来预测和数据增强的完整自监督目标,在 Atari 上限制为 100k 步环境交互的设置下,实现了 0.415 的中位数人类归一化得分,这比之前的最先进水平相对提高了 55%。值得注意的是,即使在这种有限数据机制下,SPR 在 26 款游戏中的 7 款超越了人类专家得分。与本研究相关的代码可在 https://github.com/mila-iqia/spr 获取。
引用
@article{arxiv.2007.05929,
title = {Data-Efficient Reinforcement Learning with Self-Predictive Representations},
author = {Max Schwarzer and Ankesh Anand and Rishab Goel and R Devon Hjelm and Aaron Courville and Philip Bachman},
journal= {arXiv preprint arXiv:2007.05929},
year = {2021}
}
备注
The first two authors contributed equally to this work. v4 includes new ablations and reformatting for ICLR camera ready