在 POMDP 中用自编码启发式搜索优化序贯医疗方案
人工智能
2019-05-21 v1 机器学习
摘要
健康相关数据在暗示患者真实生理状态时具有噪声与随机性,限制了单时刻观测所含信息对序贯临床决策的作用。我们将患者-临床医生交互建模为部分可观测马尔可夫决策过程(POMDP),并基于从历史序列推断的信念状态优化序贯治疗。为辅助推断,我们构建变分生成模型,并用循环神经网络(RNN)增强状态表示,引入来自序列自编码的辅助损失。同时,我们用 actor-critic 方法优化药物水平的连续策略,其中策略梯度由优势函数的稳定离策略估计获得,信念状态的值由并行最佳优先后缀树回推。我们利用回顾性重症监护数据集,将该方法用于优化脓毒症患者血管活性药与静脉液体的剂量,并用离策略策略评估(OPPE)评价所学策略。结果表明,建模为 POMDP 优于 MDP,且引入启发式搜索提升了样本效率。
引用
@article{arxiv.1905.07465,
title = {Optimizing Sequential Medical Treatments with Auto-Encoding Heuristic Search in POMDPs},
author = {Luchen Li and Matthieu Komorowski and Aldo A. Faisal},
journal= {arXiv preprint arXiv:1905.07465},
year = {2019}
}