中文

基于案例的离屏策略评估:利用原型学习

机器学习 2021-11-23 v1

摘要

重要性采样(IS)常用于执行离屏策略评估,但容易出现若干问题,尤其是在行为策略未知且必须从数据中估计时。目标策略与行为策略之间的显著差异可能导致不确定的价值估计,例如由于高方差和未被评估的动作。如果使用黑盒模型估计行为策略,则很难诊断潜在问题,也难以确定在哪些输入上策略所建议的动作及相应价值存在差异。为此,我们提出使用原型学习来估计 IS 所需的行为策略。我们将该方法应用于脓毒症治疗策略的评估中,展示了原型如何对目标策略与行为策略之间的差异给出凝练的总结,同时保持与基线估计器相当的准确性。我们还根据原型描述估计价值,以更好地理解目标策略的哪些部分对估计值影响最大。利用模拟器,我们研究了将模型限制为使用原型所带来的偏差。

关键词

引用

@article{arxiv.2111.11113,
  title  = {Case-based off-policy policy evaluation using prototype learning},
  author = {Anton Matsson and Fredrik D. Johansson},
  journal= {arXiv preprint arXiv:2111.11113},
  year   = {2021}
}