中文

基于对比学习的离线元强化学习鲁棒任务表示

机器学习 2022-06-22 v1

摘要

我们研究离线元强化学习,这是一种从离线数据中学习以适配新任务的实用强化学习范式。离线数据的分布由行为策略与任务共同决定。现有的离线元强化学习算法无法区分这些因素,使得任务表示对行为策略的变化不稳定。为解决该问题,我们提出了一种对比学习框架,用于获得对训练与测试中行为策略分布失配具有鲁棒性的任务表示。我们设计了双层编码器结构,利用互信息最大化形式化任务表示学习,推导了对比学习目标,并引入了若干方法来近似负样本对的真实分布。在多种离线元强化学习基准上的实验表明了我们的方法相对于先前方法的优势,尤其是在对分布外行为策略的泛化方面。代码见 https://github.com/PKU-AI-Edge/CORRO。

关键词

引用

@article{arxiv.2206.10442,
  title  = {Robust Task Representations for Offline Meta-Reinforcement Learning via Contrastive Learning},
  author = {Haoqi Yuan and Zongqing Lu},
  journal= {arXiv preprint arXiv:2206.10442},
  year   = {2022}
}

备注

ICML 2022