基于回报的对比表示学习用于强化学习
机器学习
2021-02-23 v1
摘要
近年来,人们提出了各种辅助任务以加速深度强化学习(RL)中的表示学习并提高样本效率。然而,现有的辅助任务未考虑 RL 问题的特性且为无监督的。通过利用回报(RL 中最重要的反馈信号),我们提出了一种新颖的辅助任务,迫使学习到的表示区分具有不同回报的状态-动作对。我们的辅助损失在理论上有依据,可学习到捕捉一种新形式的状态-动作抽象结构的表示,在该抽象下具有相似回报分布的状态-动作对被聚合在一起。在低数据场景下,我们的算法在 Atari 游戏和 DeepMind Control 套件的复杂任务上优于强基线,并且与现有辅助任务结合时取得了更好的性能。
引用
@article{arxiv.2102.10960,
title = {Return-Based Contrastive Representation Learning for Reinforcement Learning},
author = {Guoqing Liu and Chuheng Zhang and Li Zhao and Tao Qin and Jinhua Zhu and Jian Li and Nenghai Yu and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2102.10960},
year = {2021}
}
备注
ICLR 2021