不确定性下序列医疗决策中的学习延迟决策
机器学习
2022-12-06 v2 机器学习
摘要
学习延迟决策(learning-to-defer)是一种当基于机器学习的决策被认为不可靠时自动将其推迟给人类专家的框架。现有的学习延迟决策框架并非为序列环境设计。也就是说,它们基于即时预测独立地在每个实例上延迟,而忽略了这些干预的潜在长期影响。因此,现有框架是短视的。此外,它们并非自适应地延迟,而当人类干预代价高昂时,这一点至关重要。在这项工作中,我们提出了序列学习延迟决策(SLTD),一种在序列决策环境中向领域专家学习延迟决策的框架。与现有文献相反,我们将学习延迟决策问题表述为基于模型的强化学习(RL),以 i) 利用 RL 考虑基于机器学习的动作的长期后果,以及 ii) 基于动态(基于模型)自适应地延迟。我们提出的框架通过量化当前延迟是否会比将延迟推迟到下一时间步改善价值,来决定是否(在每个时间步)延迟。为了量化改善程度,我们考虑了潜在的未来延迟。因此,我们学习了一种先发制人的延迟策略(即,如果使用基于机器学习的策略可能恶化长期结果,则尽早延迟的策略)。我们的延迟策略适应动态中的非平稳性。我们证明了通过 SLTD 的自适应延迟在具有非平稳动态的合成、半合成和真实世界数据上提供了长期结果和延迟频率之间改进的权衡。最后,我们通过分解围绕结果传播的(长期)不确定性来解释延迟决策,以证明延迟决策的合理性。
引用
@article{arxiv.2109.06312,
title = {Learning-to-defer for sequential medical decision-making under uncertainty},
author = {Shalmali Joshi and Sonali Parbhoo and Finale Doshi-Velez},
journal= {arXiv preprint arXiv:2109.06312},
year = {2022}
}