中文

基于价值的情景记忆离线强化学习

机器学习 2021-10-20 v1 人工智能

摘要

离线强化学习(RL)通过有效利用先前收集的数据,展现出将RL应用于现实问题的前景。多数现有离线RL算法使用正则化或约束来抑制数据集外动作的 extrapolation 误差。本文采用不同框架,学习V函数而非Q函数,以自然地将学习过程保持在离线数据集的支持内。为在离线学习中实现有效泛化同时保持适当保守性,我们提出期望分位数V学习(EVL),其在最优值学习与行为克隆之间平滑插值。进一步,我们引入沿离线轨迹的隐式规划以增强所学V值并加速收敛。综上,我们提出一种称为基于价值的情景记忆(VEM)的新离线方法。我们对所提VEM方法的收敛性质提供理论分析,且D4RL基准中的实证结果表明,我们的方法在多数任务中取得优越性能,尤其在稀疏奖励任务中。

关键词

引用

@article{arxiv.2110.09796,
  title  = {Offline Reinforcement Learning with Value-based Episodic Memory},
  author = {Xiaoteng Ma and Yiqin Yang and Hao Hu and Qihan Liu and Jun Yang and Chongjie Zhang and Qianchuan Zhao and Bin Liang},
  journal= {arXiv preprint arXiv:2110.09796},
  year   = {2021}
}