FOCAL:基于距离度量学习与行为正则化的高效全离线元强化学习
机器学习
2021-05-07 v4 机器学习
摘要
我们研究离线元强化学习(OMRL)问题,该范式使强化学习(RL)算法能够在无需与环境进行任何交互的情况下快速适应未见任务,从而使RL在众多真实世界应用中真正实用。该问题尚未被充分理解,其面临两大主要挑战:首先,离线RL通常受分布外状态-动作的自举误差影响,导致价值函数发散;其次,元RL需要与控制策略联合学习高效且鲁棒的任务推断。本工作中,我们对所学策略施加行为正则化作为离线RL的通用方法,并结合确定性上下文编码器以实现高效任务推断。我们提出了一种有界上下文嵌入空间上的新型负幂距离度量,其梯度传播与Bellman备份解耦。我们分析并揭示,一些简单的设计选择即可相较近期涉及元RL与距离度量学习的方法带来显著提升。据我们所知,我们的方法是首个无模型且端到端的OMRL算法,其计算高效,并在多个元RL基准上优于已有算法。
引用
@article{arxiv.2010.01112,
title = {FOCAL: Efficient Fully-Offline Meta-Reinforcement Learning via Distance Metric Learning and Behavior Regularization},
author = {Lanqing Li and Rui Yang and Dijun Luo},
journal= {arXiv preprint arXiv:2010.01112},
year = {2021}
}
备注
23 pages, 11 figures