用于离屏策略评估与离线强化学习的混合值估计
机器学习
2022-06-07 v1
摘要
值函数估计是强化学习中不可或缺的子系统,在离线设置下更具挑战性。本文提出混合值估计(HVE)以降低值估计误差,通过在来自离线数据的值估计与所学模型之间进行权衡来平衡偏差与方差。理论分析表明 HVE 比直接方法具有更优的误差界。HVE 可用于离屏策略评估与离线强化学习两种设置。为此,我们分别给出两种具体算法:离屏策略 HVE(OPHVE)与基于模型的离线 HVE(MOHVE)。在 MuJoCo 任务上的实证评估佐证了理论论断。OPHVE 在衡量估计有效性的全部三项指标上优于其他离屏策略评估方法,而 MOHVE 取得了优于或与最先进离线强化学习算法相当的性能。我们希望 HVE 能为基于固定数据的强化学习进一步研究提供启示。
引用
@article{arxiv.2206.02000,
title = {Hybrid Value Estimation for Off-policy Evaluation and Offline Reinforcement Learning},
author = {Xue-Kun Jin and Xu-Hui Liu and Shengyi Jiang and Yang Yu},
journal= {arXiv preprint arXiv:2206.02000},
year = {2022}
}