一种用于处理脓毒症治疗策略中分布偏移的保守 Q 学习方法
机器学习
2022-03-29 v1
摘要
脓毒症是主要的死亡原因且其治疗费用极为高昂。脓毒症治疗也极具挑战性,因为对于何种干预措施效果最佳尚无共识,且不同患者对相同治疗的反应差异很大。深度强化学习方法可用于制定反映医生行为的治疗策略最优策略。在医疗场景中,可用数据大多以离线方式收集,无法与环境交互,这就需要使用离线 RL 技术。离线 RL 范式存在动作分布偏移问题,这反过来会对学习最优治疗策略产生负面影响。本工作中,采用保守 Q 学习(Conservative-Q Learning, CQL)算法来缓解这种偏移,其相应策略比常规深度 Q 学习更接近医生策略。所学得的策略可帮助重症监护病房的临床医生在治疗脓毒症患者时做出更好的决策并提高存活率。
引用
@article{arxiv.2203.13884,
title = {A Conservative Q-Learning approach for handling distribution shift in sepsis treatment strategies},
author = {Pramod Kaushik and Sneha Kummetha and Perusha Moodley and Raju S. Bapi},
journal= {arXiv preprint arXiv:2203.13884},
year = {2022}
}