高置信度离屏策略(或反事实)方差估计
机器学习
2021-01-26 v1
摘要
许多序贯决策系统利用先前策略收集的数据来提出新策略。对于关键应用,在部署前对新策略的行为提供高置信度保证十分重要,以确保策略按预期运行。已有研究探讨了期望回报的离屏策略高置信度估计,然而,对于高风险应用,回报方差的离屏策略高置信度估计同样关键。在本文中,我们解决了此前未解决的、以高置信度估计并界定离屏数据下回报方差的问题。
引用
@article{arxiv.2101.09847,
title = {High-Confidence Off-Policy (or Counterfactual) Variance Estimation},
author = {Yash Chandak and Shiv Shankar and Philip S. Thomas},
journal= {arXiv preprint arXiv:2101.09847},
year = {2021}
}
备注
Thirty-fifth AAAI Conference on Artificial Intelligence (AAAI 2021)