将表示学习与强化学习解耦
机器学习
2021-05-18 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
为克服基于图像的深度强化学习(RL)中奖励驱动特征学习的局限性,我们提出将表示学习与策略学习解耦。为此,我们引入一种新的无监督学习(UL)任务,称为增强时序对比(Augmented Temporal Contrast, ATC),其训练一个卷积编码器在图像增强下利用对比损失将相隔较短时间差的观测对关联起来。在在线 RL 实验中,我们表明仅使用 ATC 训练编码器在大多数环境中匹配或优于端到端 RL。此外,我们通过在专家演示上预训练编码器并在 RL 智能体中冻结权重使用,对几种领先的 UL 算法进行基准测试;我们发现使用 ATC 训练编码器的智能体优于所有其他智能体。我们还在多环境数据上训练多任务编码器,并展示对不同的下游 RL 任务的泛化能力。最后,我们对 ATC 的组件进行消融,并引入一种新的数据增强,以在 RL 需要增强时支持从预训练编码器回放(压缩的)潜在图像。我们的实验涵盖 DeepMind Control、DeepMind Lab 和 Atari 中视觉多样的 RL 基准,完整代码可在 https://github.com/astooke/rlpyt/tree/master/rlpyt/ul 获取。
引用
@article{arxiv.2009.08319,
title = {Decoupling Representation Learning from Reinforcement Learning},
author = {Adam Stooke and Kimin Lee and Pieter Abbeel and Michael Laskin},
journal= {arXiv preprint arXiv:2009.08319},
year = {2021}
}
备注
Improved related works and fixed code hyperlink