基于价值的情景记忆离线强化学习
机器学习
2021-10-20 v1 人工智能
摘要
离线强化学习(RL)通过有效利用先前收集的数据,展现出将RL应用于现实问题的前景。多数现有离线RL算法使用正则化或约束来抑制数据集外动作的 extrapolation 误差。本文采用不同框架,学习V函数而非Q函数,以自然地将学习过程保持在离线数据集的支持内。为在离线学习中实现有效泛化同时保持适当保守性,我们提出期望分位数V学习(EVL),其在最优值学习与行为克隆之间平滑插值。进一步,我们引入沿离线轨迹的隐式规划以增强所学V值并加速收敛。综上,我们提出一种称为基于价值的情景记忆(VEM)的新离线方法。我们对所提VEM方法的收敛性质提供理论分析,且D4RL基准中的实证结果表明,我们的方法在多数任务中取得优越性能,尤其在稀疏奖励任务中。
引用
@article{arxiv.2110.09796,
title = {Offline Reinforcement Learning with Value-based Episodic Memory},
author = {Xiaoteng Ma and Yiqin Yang and Hao Hu and Qihan Liu and Jun Yang and Chongjie Zhang and Qianchuan Zhao and Bin Liang},
journal= {arXiv preprint arXiv:2110.09796},
year = {2021}
}