确定性策略的离线策略价值与梯度双鲁棒估计
机器学习
2020-06-09 v1 最优化与控制
机器学习
摘要
离线强化学习利用由固定行为策略记录的离线策略数据来评估和学出新策略,在医学等实验受限的应用中至关重要。我们研究在动作为连续值时,从离线策略数据估计确定性策略的策略价值和梯度的问题。以确定性策略(其动作是状态的确定性函数)为目标至关重要,因为最优策略总是确定性的(平局情况除外)。在此设定下,用于策略价值和梯度的标准重要性采样和双鲁棒估计器失效,因为密度比不存在。为规避此问题,我们基于不同的核化方法提出了若干新的双鲁棒估计器。我们在 nuisance 估计器的温和速率条件下分析了它们各自的渐近均方误差。具体而言,我们展示了如何获得与 horizon 长度无关的速率。
引用
@article{arxiv.2006.03900,
title = {Doubly Robust Off-Policy Value and Gradient Estimation for Deterministic Policies},
author = {Nathan Kallus and Masatoshi Uehara},
journal= {arXiv preprint arXiv:2006.03900},
year = {2020}
}