揭示离策略评估中基于估计的历史相关行为策略的重要性采样悖论
机器学习
2025-05-29 v1 人工智能
机器学习
摘要
本文研究强化学习中的离策略评估(Off-Policy Evaluation, OPE),重点关注重要性采样的行为策略估计。先前的工作通过实验表明,即使真实的行为策略是马尔可夫的,估计一个历史相关的行为策略也能带来更低的均方误差(Mean Squared Error, MSE)。然而,为什么使用历史会降低 MSE 的问题仍然悬而未决。在本文中,我们通过推导普通重要性采样(Importance Sampling, IS)估计量 MSE 的偏差-方差分解,在理论上揭示了这一悖论,证明历史相关的行为策略估计降低了它们的渐近方差,同时增加了它们的有限样本偏差。此外,随着估计的行为策略以更长的历史为条件,我们表明方差会持续下降。我们将这些发现扩展到一系列其他 OPE 估计量,包括序贯 IS 估计量、双重鲁棒估计量和边缘化 IS 估计量,无论行为策略是参数化还是非参数化估计的。
引用
@article{arxiv.2505.22492,
title = {Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation},
author = {Hongyi Zhou and Josiah P. Hanna and Jin Zhu and Ying Yang and Chengchun Shi},
journal= {arXiv preprint arXiv:2505.22492},
year = {2025}
}
备注
Accepted by ICML 2025