中文

基于回报的对比表示学习用于强化学习

机器学习 2021-02-23 v1

摘要

近年来,人们提出了各种辅助任务以加速深度强化学习(RL)中的表示学习并提高样本效率。然而,现有的辅助任务未考虑 RL 问题的特性且为无监督的。通过利用回报(RL 中最重要的反馈信号),我们提出了一种新颖的辅助任务,迫使学习到的表示区分具有不同回报的状态-动作对。我们的辅助损失在理论上有依据,可学习到捕捉一种新形式的状态-动作抽象结构的表示,在该抽象下具有相似回报分布的状态-动作对被聚合在一起。在低数据场景下,我们的算法在 Atari 游戏和 DeepMind Control 套件的复杂任务上优于强基线,并且与现有辅助任务结合时取得了更好的性能。

关键词

引用

@article{arxiv.2102.10960,
  title  = {Return-Based Contrastive Representation Learning for Reinforcement Learning},
  author = {Guoqing Liu and Chuheng Zhang and Li Zhao and Tao Qin and Jinhua Zhu and Jian Li and Nenghai Yu and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2102.10960},
  year   = {2021}
}

备注

ICLR 2021