中文

离屏策略评估的非渐近置信区间:原始与对偶界

机器学习 2021-03-11 v1 机器学习

摘要

离屏策略评估(OPE)是基于先前在不同策略下收集的离线数据来估计给定策略期望回报的任务。因此,OPE是将强化学习应用于医疗等真实领域的关键步骤,在这些领域中交互式数据收集代价高昂甚至不安全。由于观测数据往往有噪声且有限,在将OPE应用于高风险决策时,提供严格的不确定性量化而不仅是点估计至关重要。本工作考虑无限 horizon 离屏策略评估中非渐近置信区间的构造问题,这仍是一个具有挑战性的开放问题。我们通过基于原始-对偶优化的方法开发了一种实用算法,该算法利用了Feng等人(2019)的核Bellman损失(KBL)以及适用于具有未知混合条件的时依数据的一种新的KBL鞅集中不等式。我们的算法对数据和Q函数函数类的假设最小,并且适用于行为不可知设定,即数据由任意未知行为策略的混合收集。我们给出的实证结果清晰地展示了我们的方法相对于现有方法的优势。

关键词

引用

@article{arxiv.2103.05741,
  title  = {Non-asymptotic Confidence Intervals of Off-policy Evaluation: Primal and Dual Bounds},
  author = {Yihao Feng and Ziyang Tang and Na Zhang and Qiang Liu},
  journal= {arXiv preprint arXiv:2103.05741},
  year   = {2021}
}

备注

33 Pages, 5 figures, extended version of a paper with the same title accepted by ICLR2021