基于注意力与对比学习的可证明改进上下文离线元强化学习
机器学习
2021-10-18 v2 人工智能
摘要
离线强化学习(OMRL)的元学习是一个研究不足但具有巨大潜在影响的问题,可使RL算法应用于许多现实场景。该问题的一个流行解法是使用基于上下文的编码器将任务身份推断为增广状态,其中鲁棒任务表示的高效学习仍是一项开放挑战。本工作中,我们通过融入任务内注意力机制与任务间对比学习目标,可证明地改进了SOTA OMRL算法之一FOCAL,以针对稀疏奖励与分布偏移鲁棒化任务表示学习。我们给出理论分析与实验,以证明我们的端到端无模型框架相较先前算法在多个元RL基准上的优越性能与鲁棒性。
引用
@article{arxiv.2102.10774,
title = {Provably Improved Context-Based Offline Meta-RL with Attention and Contrastive Learning},
author = {Lanqing Li and Yuanhao Huang and Mingzhe Chen and Siteng Luo and Dijun Luo and Junzhou Huang},
journal= {arXiv preprint arXiv:2102.10774},
year = {2021}
}
备注
21 pages, 7 figures