临床医生在环决策:基于近最优集值策略的强化学习
机器学习
2020-07-27 v1 人工智能
机器学习
摘要
标准强化学习(RL)旨在寻找一个最优策略,为每个状态确定最佳动作。然而,在医疗保健环境中,许多动作在奖励(例如,生存率)方面可能是近乎等效的。我们考虑一个替代目标——学习集值策略以捕获导致相似累积奖励的近等效动作。我们提出了一种基于时序差分学习的无模型算法,以及一种用于动作选择的近贪婪启发式方法。我们分析了所提算法的理论性质,提供了最优性保证,并在模拟环境和一项真实临床任务上展示了我们的方法。实验表明,所提算法具有良好的收敛特性,并能发现有意义且近乎等效的动作。我们的工作为临床医生/人在环决策提供了理论和实践基础,在此类决策中,人类(例如临床医生、患者)可以在近乎等效的动作中进行选择时,纳入额外的知识(例如副作用、患者偏好)。
引用
@article{arxiv.2007.12678,
title = {Clinician-in-the-Loop Decision Making: Reinforcement Learning with Near-Optimal Set-Valued Policies},
author = {Shengpu Tang and Aditya Modi and Michael W. Sjoding and Jenna Wiens},
journal= {arXiv preprint arXiv:2007.12678},
year = {2020}
}
备注
ICML 2020. Code available at https://github.com/shengpu1126/RL-Set-Valued-Policy