中文

用于医疗决策中离屏 POMDP 学习的行动者搜索树评判器(ASTC)

人工智能 2018-06-05 v3

摘要

离屏强化学习能够从次优经验中得到近最优策略,从而为人工智能在医疗中的应用提供机会。先前的工作主要将患者-临床医生交互建模为马尔可夫决策过程,而真实的生理状态未必能从临床数据中完全观测。我们用部分可观测马尔可夫决策过程刻画这一情形,其中智能体在由从个体历史轨迹推断出的患者状态分布所表示的信念中优化其动作。对观测数据拟合了高斯混合模型。此外,我们考虑到药物剂量中的细微差别可能导致显著不同的效应,通过在策略空间(即行动者)中直接用高斯近似器建模连续策略。为应对可能信念状态数量无限导致精确值迭代难以处理的挑战,我们仅对每一个遇到的信念通过启发式搜索树进行评估与规划,并紧密维护信念真实值的上下界。我们进一步借助函数近似来更新值界估计,即评判器,从而使树搜索能通过传播回根节点的边缘节点处更紧凑的界得以改进。行动者与评判器参数均通过基于梯度的方法学习。我们提出的从真实重症监护单元数据训练出的策略,能够为脓毒症患者决定血管加压药和静脉液体的给药,从而获得最佳患者结局。

关键词

引用

@article{arxiv.1805.11548,
  title  = {The Actor Search Tree Critic (ASTC) for Off-Policy POMDP Learning in Medical Decision Making},
  author = {Luchen Li and Matthieu Komorowski and Aldo A. Faisal},
  journal= {arXiv preprint arXiv:1805.11548},
  year   = {2018}
}