情境化策略恢复:基于自适应模仿学习的医疗决策建模与解释
机器学习
2024-05-09 v4 人工智能
机器学习
摘要
可解释策略学习旨在从观测动作中估计可理解的决策策略;然而,现有模型迫使准确性与可解释性之间做出权衡,限制了对人类决策过程的数据驱动解释。从根本上说,现有方法受困于这一权衡,因为它们将底层决策过程表示为一个通用策略,而实际上人类决策是动态的,并会在不同情境下发生剧烈变化。因此,我们提出了情境化策略恢复(Contextualized Policy Recovery, CPR),该方法将建模复杂决策过程的问题重新构建为一个多任务学习问题,其中每个情境构成一个独特任务,复杂决策策略可由许多简单的情境特定策略分段构建。CPR将每个情境特定策略建模为线性映射,并随着情境被新观测更新而按需生成新的策略模型。我们提供了CPR框架的两种变体:一种侧重于精确的局部可解释性,另一种保持完全的全局可解释性。我们通过模拟和真实数据研究评估了CPR,在预测重症监护病房抗生素处方(相较先前SOTA提升+22% AUROC)和预测阿尔茨海默病患者MRI处方(相较先前SOTA提升+7.7% AUROC)上取得了最先进的性能。借助这一提升,CPR弥合了可解释方法与黑盒方法之间的准确性差距,从而实现对情境特定决策模型的高分辨率探索与分析。
引用
@article{arxiv.2310.07918,
title = {Contextualized Policy Recovery: Modeling and Interpreting Medical Decisions with Adaptive Imitation Learning},
author = {Jannik Deuschel and Caleb N. Ellington and Yingtao Luo and Benjamin J. Lengerich and Pascal Friederich and Eric P. Xing},
journal= {arXiv preprint arXiv:2310.07918},
year = {2024}
}