中文

CLUE:面向离线强化学习的校准隐空间引导

机器学习 2023-10-17 v2

摘要

离线强化学习(RL)旨在从预先收集和标注的数据集中学习最优策略,从而消除了在线 RL 中耗时的数据收集过程。然而,离线 RL 仍然承担着为离线数据中每次转移指定/手工设计外在奖励的沉重负担。作为对劳动密集型标注的补救,我们提出为离线 RL 任务赋予少量专家数据,并利用有限的专家数据来驱动内在奖励,从而消除对外在奖励的需求。为此,我们引入了校准隐空间引导(CLUE),其利用条件变分自编码器学习一个隐空间,使得内在奖励可以直接在该隐空间上量化。CLUE 的关键思想是通过将专家数据的嵌入强制对齐到校准的上下文表示,使内在奖励与专家意图保持一致。我们在稀疏奖励离线 RL 任务、离线模仿学习(IL)任务和无监督离线 RL 任务中实例化了专家驱动的内在奖励。通过实验,我们发现 CLUE 能够有效提升稀疏奖励离线 RL 性能,优于最先进的离线 IL 基线,并从静态无奖励离线数据中发现多样化技能。

关键词

引用

@article{arxiv.2306.13412,
  title  = {CLUE: Calibrated Latent Guidance for Offline Reinforcement Learning},
  author = {Jinxin Liu and Lipeng Zu and Li He and Donglin Wang},
  journal= {arXiv preprint arXiv:2306.13412},
  year   = {2023}
}

备注

CoRL 2023