基于状态重要性采样的低方差离屏策略评估
机器学习
2024-05-07 v5 人工智能
摘要
在许多领域中,强化学习的探索过程代价过高,因其需尝试次优策略,从而产生了离屏策略评估的需求——即基于已知行为策略收集的数据来评估目标策略。在此背景下,重要性采样估计器通过依据目标策略与行为策略的概率比对轨迹加权,给出期望回报的估计。遗憾的是,此类估计器方差高,因而均方误差大。本文提出基于状态的重要性采样估计器,其通过从重要性权重计算中舍弃特定状态来降低方差。为说明其适用性,我们给出了普通重要性采样、加权重要性采样、逐决策重要性采样、增量重要性采样、双重稳健离屏策略评估以及平稳密度比估计的状态基变体。在四个领域的实验表明,与传统对应方法相比,基于状态的方法一致地产生更低的方差与更高的准确度。
引用
@article{arxiv.2212.03932,
title = {Low Variance Off-policy Evaluation with State-based Importance Sampling},
author = {David M. Bossens and Philip S. Thomas},
journal= {arXiv preprint arXiv:2212.03932},
year = {2024}
}