中文

CoinDICE:离屏置信区间估计

机器学习 2020-10-23 v1 机器学习

摘要

我们研究强化学习中的高置信、行为无关离屏策略评估,其目标是在仅能访问由未知行为策略收集的静态经验数据集的情况下,估计目标策略价值的置信区间。从 QQ 函数线性规划公式的函数空间嵌入出发,我们得到一个带有广义估计方程约束的优化问题。通过对所得拉格朗日量应用广义经验似然方法,我们提出了 CoinDICE,一种用于计算置信区间的新型高效算法。在理论上,我们证明了所获得的置信区间在渐近和有限样本两种情形下都是有效的。在经验上,我们在多种基准测试中表明,置信区间估计比现有方法更紧且更准确。

关键词

引用

@article{arxiv.2010.11652,
  title  = {CoinDICE: Off-Policy Confidence Interval Estimation},
  author = {Bo Dai and Ofir Nachum and Yinlam Chow and Lihong Li and Csaba Szepesvári and Dale Schuurmans},
  journal= {arXiv preprint arXiv:2010.11652},
  year   = {2020}
}

备注

To appear at NeurIPS 2020 as spotlight