中文

离策略策略评估中的行为策略估计:校准至关重要

机器学习 2018-07-11 v2 机器学习

摘要

在这项工作中,我们考虑在真实行为策略未知时,估计用于离策略策略评估(OPE)的行为策略的问题。通过一系列实证研究,我们展示了准确的 OPE 如何强烈依赖于所估计行为策略模型的校准程度:即从数据中估计行为策略的精确程度。我们展示了诸如神经网络等强大的参数模型如何在真实世界医疗数据集上导致高度未校准的行为策略模型,并说明了简单的非参数 k 近邻模型能产生更好校准的行为策略估计,并可用于获得更优的基于重要性采样的 OPE 估计。

关键词

引用

@article{arxiv.1807.01066,
  title  = {Behaviour Policy Estimation in Off-Policy Policy Evaluation: Calibration Matters},
  author = {Aniruddh Raghu and Omer Gottesman and Yao Liu and Matthieu Komorowski and Aldo Faisal and Finale Doshi-Velez and Emma Brunskill},
  journal= {arXiv preprint arXiv:1807.01066},
  year   = {2018}
}

备注

Accepted to workshop on Machine Learning for Causal Inference, Counterfactual Prediction, and Autonomous Action at ICML 2018