作为目标条件强化学习的对比学习
机器学习
2023-02-21 v2 人工智能
摘要
在强化学习(RL)中,若给定良好的表示,则任务更易求解。尽管深度RL应自动获取此类良好表示,先前工作常发现以端到端方式学习表示不稳定,转而给RL算法配备额外的表示学习部件(例如辅助损失、数据增强)。我们如何设计能直接获取良好表示的RL算法?本文中,我们不为现有RL算法添加表示学习部件,而是表明(对比)表示学习方法本身可被视为RL算法。为此,我们基于先前工作,将对比表示学习应用于带动作标签的轨迹,使得所学表示的(内积)恰好对应于目标条件价值函数。我们利用该思想将一种先前RL方法重新解释为执行对比学习,进而利用该思想提出一种更简洁且取得相似性能的方法。在一系列目标条件RL任务中,我们证明对比RL方法比先前非对比方法达到更高的成功率,包括在离线RL设置中。我们还表明,在基于图像的任务上,对比RL无需使用数据增强或辅助目标即优于先前方法。
引用
@article{arxiv.2206.07568,
title = {Contrastive Learning as Goal-Conditioned Reinforcement Learning},
author = {Benjamin Eysenbach and Tianjun Zhang and Ruslan Salakhutdinov and Sergey Levine},
journal= {arXiv preprint arXiv:2206.07568},
year = {2023}
}
备注
NeurIPS 2022. Code is available on the website: https://ben-eysenbach.github.io/contrastive_rl