基于核 Bellman 统计的可问责离屏策略评估
机器学习
2020-08-18 v1 机器学习
摘要
我们考虑离屏策略评估(OPE),其从先前实验收集的观测数据中评估新策略的性能,而无需执行该新策略。这在执行成本高或存在安全担忧的领域有重要应用,如医疗诊断、推荐系统与机器人。实践中,由于离屏策略数据信息有限,构建策略性能的严格置信区间(而非仅点估计)极为必要。本工作中,我们提出一种新的变分框架,将 OPE 中计算紧致置信界的问题转化为在一个以高概率捕获真实状态-动作值函数的可行集上的优化问题。该可行集通过利用近期提出的核 Bellman 损失(Feng 等,2019)的统计性质构建。我们设计了高效计算方法以计算所提界,并将其扩展用于对现有估计量进行事后诊断与修正。实证结果显示我们的方法在不同设定下产生紧致置信区间。
引用
@article{arxiv.2008.06668,
title = {Accountable Off-Policy Evaluation With Kernel Bellman Statistics},
author = {Yihao Feng and Tongzheng Ren and Ziyang Tang and Qiang Liu},
journal= {arXiv preprint arXiv:2008.06668},
year = {2020}
}
备注
22 pages, 4 figures, ICML 2020