用于马尔可夫决策过程中高效离策略评估的双重强化学习
机器学习
2020-06-08 v3 人工智能
机器学习
摘要
强化学习中的离策略评估(OPE)允许在不进行探索的情况下评估新的决策策略,而探索通常代价高昂或不可行。我们首次考虑了马尔可夫决策过程(MDP)中 OPE 的半参数效率极限,其中动作、奖励和状态是无记忆的。我们证明了现有的 OPE 估计量在此设定下可能无法达到有效。我们基于 q 函数和边缘化密度比的交叉折叠估计,开发了一种新的估计量,称之为双重强化学习(DRL)。我们证明当两个分量均以四次方根速率估计时,DRL 是有效的,并且当只有一个分量一致时,它也是双重稳健的。我们通过实验研究了这些性质,并展示了利用无记忆性带来的性能优势。
引用
@article{arxiv.1908.08526,
title = {Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes},
author = {Nathan Kallus and Masatoshi Uehara},
journal= {arXiv preprint arXiv:1908.08526},
year = {2020}
}