动态治疗方案的近似等价Q学习策略
机器学习
2026-03-23 v1 机器学习
摘要
精准医疗旨在根据患者个体特征定制治疗决策。该目标通常通过动态治疗方案来形式化,该方案利用统计和机器学习方法推导适应不断演变的临床信息的序贯决策规则。在大多数现有公式中,这些方法在每一阶段产生单一最优治疗,从而形成唯一的决策序列。然而,在许多临床环境中,多种治疗方案可能产生相似的预期结果,而仅关注单一最优策略可能会掩盖有意义的替代方案。我们通过引入由超参数 控制的最差值容忍度准则扩展了回顾性数据的Q学习框架,该准则指定了与最优期望值的最大可接受偏差。该方法不识别单一最优策略,而是构建了 -最优策略集,其性能保持在最优值受控的邻域内。该公式将Q学习从向量值表示转变为矩阵值表示,允许多个可接受的价值函数在反向递归中共存。该方法产生了近似等价的治疗策略族,并明确识别了治疗无差异区域,在这些区域中若干决策取得了可比的结果。我们在两种场景中展示了该框架:一个突出决策边界周围无差异区域的单阶段问题,以及一个基于模拟肿瘤学模型的多阶段决策过程,该模型描述了肿瘤大小和治疗毒性动态。
引用
@article{arxiv.2603.19440,
title = {Near-Equivalent Q-learning Policies for Dynamic Treatment Regimes},
author = {Sophia Yazzourh and Erica E. M. Moodie},
journal= {arXiv preprint arXiv:2603.19440},
year = {2026}
}
备注
13 pages, 2 figures