在连续状态空间中寻找反事实最优动作序列
机器学习
2023-11-07 v2 人工智能
计算机与社会
机器学习
摘要
每当临床医生反思一系列治疗决策对患者的疗效时,他们可能会试图识别关键时间步——若在那些时刻做出不同决策,患者健康本可改善。尽管因果推断与强化学习交叉领域的最新方法有助上述临床医生等人类专家回溯分析序列决策过程,但它们聚焦于具有有限多离散状态的环境。然而,在许多实际应用中,环境状态本质上是连续的。本文旨在填补这一空白。我们首先利用有限时域马尔可夫决策过程和一类广泛的可逆结构因果模型,对离散动作与连续状态的序列进行形式化刻画。基于此刻画,我们形式化了寻找反事实最优动作序列的问题,并表明一般而言无法期望在多项式时间内求解该问题。随后,我们开发了一种基于 算法的搜索方法,在环境动力学具有自然 Lipschitz 连续性形式下,保证返回该问题的最优解。在真实临床数据上的实验表明,我们的方法在实践中非常高效,并有望为序列决策任务提供有价值的见解。
引用
@article{arxiv.2306.03929,
title = {Finding Counterfactually Optimal Action Sequences in Continuous State Spaces},
author = {Stratis Tsirtsis and Manuel Gomez-Rodriguez},
journal= {arXiv preprint arXiv:2306.03929},
year = {2023}
}
备注
Accepted at NeurIPS 2023