DTR Bandit:以低后悔学习制定响应自适应决策
机器学习
2022-09-22 v3 机器学习
最优化与控制
摘要
动态治疗策略(DTRs)是个性化、自适应、多阶段的治疗计划,其根据个体的初始特征以及每个后续阶段受前序阶段决策影响的中间结局与特征来调整治疗决策。例子包括慢性病(如糖尿病、癌症和抑郁症)的个性化一线与二线治疗,其根据患者对一线治疗的反应、疾病进展和个体特征进行调整。虽然现有文献主要关注从离线数据(如序贯随机试验)中估计最优 DTR,我们研究以在线方式开发最优 DTR 的问题,其中与每个个体的交互既影响我们的累积奖励,也影响我们用于未来学习的数据收集。我们称此为 DTR bandit 问题。我们提出一种新颖算法,通过仔细平衡探索与利用,在转移和奖励模型为线性时保证达到速率最优的后悔。我们在合成实验以及使用真实世界数据的重度抑郁症自适应治疗案例研究中展示了我们的算法及其益处。
引用
@article{arxiv.2005.02791,
title = {DTR Bandit: Learning to Make Response-Adaptive Decisions With Low Regret},
author = {Yichun Hu and Nathan Kallus},
journal= {arXiv preprint arXiv:2005.02791},
year = {2022}
}