基于Gumbel-Max结构因果模型的反事实离屏策略评估
机器学习
2021-03-04 v3 机器学习
摘要
我们引入一种离屏策略评估流程,用于突出那些应用强化学习(RL)策略可能比观测策略产生显著不同结果的片段。具体而言,我们引入一类结构因果模型(SCMs),用于在有限部分可观测马尔可夫决策过程(POMDPs)中生成反事实轨迹。我们认为这是高风险场景(如医疗健康)中离屏“调试”的有用流程;通过将RL策略与观测策略之间期望奖励差异分解为特定片段,我们可以识别出反事实奖励差异最为剧烈的片段。这进而可用于促进领域专家对特定片段的审查。我们通过脓毒症管理的合成环境展示了该流程的效用。
引用
@article{arxiv.1905.05824,
title = {Counterfactual Off-Policy Evaluation with Gumbel-Max Structural Causal Models},
author = {Michael Oberst and David Sontag},
journal= {arXiv preprint arXiv:1905.05824},
year = {2021}
}
备注
To appear in ICML 2019