TACO:面向视觉强化学习的时序隐动作驱动对比损失
机器学习
2024-05-27 v3 人工智能
摘要
尽管基于原始像素数据的强化学习(RL)近期取得了进展,样本效率低下仍是一大障碍。先前工作试图通过构建自监督辅助任务来应对这一挑战,旨在为智能体学习到的表征注入与控制相关的信息以预测未来状态。然而,这些目标往往不足以学到能够表征最优策略或价值函数的表示,且它们通常考虑具有小型抽象离散动作空间的任务,从而忽视了连续控制中动作表示学习的重要性。本文提出 TACO:时序动作驱动对比学习(Temporal Action-driven Contrastive Learning),一种简单而强大的时序对比学习方法,可促使智能体同时获取隐状态与动作表示。TACO 通过最大化当前状态与动作序列的表示同对应未来状态表示之间的互信息,来同时学习状态与动作表示。理论上可证明,TACO 学到的状态与动作表示包含控制所需的充分信息,从而提升样本效率。在在线 RL 中,TACO 在 Deepmind Control Suite 的九个具有挑战性的视觉连续控制任务上,经一百万步环境交互后平均取得 40% 的性能提升。此外,我们表明 TACO 亦可作即插即用模块嵌入现有离线视觉 RL 方法,从而在质量各异的离线数据集上确立离线视觉 RL 的新最优性能。
引用
@article{arxiv.2306.13229,
title = {TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement Learning},
author = {Ruijie Zheng and Xiyao Wang and Yanchao Sun and Shuang Ma and Jieyu Zhao and Huazhe Xu and Hal Daumé and Furong Huang},
journal= {arXiv preprint arXiv:2306.13229},
year = {2024}
}
备注
Accepted at 37th Conference on Neural Information Processing Systems (NeurIPS 2023)