中文

提升分布式强化学习:分析与医疗保健应用

机器学习 2026-04-13 v2 人工智能

摘要

研究人员和实践者越来越多地考虑利用强化学习来优化复杂领域(如机器人和医疗保健)中的决策。迄今为止,这些努力主要依赖基于期望的学习。然而,仅依赖于以期望为导向的目标可能不足以在涉及多个异构群体的高度不确定情况下做出一致的决策。虽然已引入分布式强化学习算法来建模结果的完整分布,但这些算法可能导致类似代理之间实现收益的大幅差异。这一挑战在医疗保健领域尤为突出,在该领域,医生(控制器)必须管理多个患者(次级代理),这些患者面临疾病进程不确定和异质治疗反应。我们提出了一种提升分布式强化学习(Boosted Distributional Reinforcement Learning, BDRL)算法,该算法在优化代理特定结果分布的同时,强制相似代理之间的可比性,并对其收敛性进行分析。为进一步稳定学习,我们采用后置投影步骤,其形式为受约束的凸优化问题,能够在指定容忍度内,将个体结果与高绩效参考一致。我们将该算法应用于管理美国大规模成年人群群的高血压,将个体划分为心血管疾病风险组。我们的做法通过模拟每个风险组中高绩效参考的行为,修改中位和脆弱患者的治疗方案。此外,我们发现BDRL在质量调整生命年数(QALYs)方面比强化学习基线方法在数量和一致性方面都有所提高。

关键词

引用

@article{arxiv.2604.04334,
  title  = {Boosted Distributional Reinforcement Learning: Analysis and Healthcare Applications},
  author = {Zequn Chen and Wesley J. Marrero},
  journal= {arXiv preprint arXiv:2604.04334},
  year   = {2026}
}

备注

Preprint. 40 pages,11 figures. Supplementary appendix included