中文

面向医疗治疗优化策略的离线安全强化学习

机器学习 2025-05-23 v1 系统与控制 系统与控制

摘要

在医疗场景中应用离线强化学习(RL)时,分布外(OOD)问题构成重大风险,因为不当的泛化超出临床专家范围可能导致潜在有害的建议。虽然已有方法如保守Q学习(CQL)试图解决ODD问题,但其有效性受限于仅通过抑制不确定动作来约束动作选择。这种动作唯一正则化模仿临床工作者优先考虑短期奖励的行为,但未能调节下游状态轨迹,从而限制了发现改进的长期治疗策略的潜力。为在确保状态-动作轨迹保持分布内的同时,安全地超越临床工作者的推荐提升政策,我们提出了一种基于理论的模型基离线强化学习框架,即Offline Guarded Safe Reinforcement Learning(OGSRL)。OGSRL引入一种新型双重约束机制,以可靠性和安全性提升政策。首先,构建ODD守卫者,以指定临床验证的安全政策探索区域。通过在这些区域内约束优化,使能够利用完整患者状态历史,而不脱离不受支持的状态-动作轨迹,从而可靠地探索超越临床行为的治疗策略。其次,我们引入一种安全成本约束,编码关于生理安全边界的医学知识,提供即使在训练数据可能包含潜在不安全干预的区域,也具备领域特定的安全保障。值得注意的是,我们提供了关于安全性和近最优性的理论保证:满足这些约束的政策保持在安全可靠的区域内,并实现接近数据支持的最佳可能政策的性能。

关键词

引用

@article{arxiv.2505.16242,
  title  = {Offline Guarded Safe Reinforcement Learning for Medical Treatment Optimization Strategies},
  author = {Runze Yan and Xun Shen and Akifumi Wachi and Sebastien Gros and Anni Zhao and Xiao Hu},
  journal= {arXiv preprint arXiv:2505.16242},
  year   = {2025}
}