中文

对临床重症监护中离线多目标强化学习进行基准测试

机器学习 2025-12-10 v1

摘要

在临床重症监护等场景,如强化治疗 ICU,医生面临在提高患者生存率的同时最小化资源利用(如住院时间)的复杂挑战。单目标强化学习方法通常通过优化固定的标量化奖励函数来实现,从而产生僵化的政策,无法适应不同临床优先事项的变化。多目标强化学习 (MORL) 提出了解决方案,通过学习沿帕累托前沿的一组最优政策,允许在测试时动态选择偏好。在本文中,我们在 MIMIC-IV 数据集上对三种离线 MORL 算法进行基准测试:Conditioned Conservative Pareto Q-Learning (CPQL)、Adaptive CPQL 和修改版 Pareto Efficient Decision Agent (PEDA) Decision Transformer (PEDA DT),与三种标量化单目标基线方法(BC、CQL 和 DDQN)进行比较。使用离线策略评估 (OPE) 指标,我们展示 PEDA DT 算法在灵活性方面优于静态标量化基线。我们的结果扩展了之前在医疗保健领域针对单目标 Decision Transformer 的研究,证实序列建模架构在扩展到多目标条件生成时仍然稳健有效。这些发现表明,离线 MORL 是实现无需重新训练即可在临床重症监护中实现个人化、可调决策的有前景的框架。

关键词

引用

@article{arxiv.2512.08012,
  title  = {Benchmarking Offline Multi-Objective Reinforcement Learning in Critical Care},
  author = {Aryaman Bansal and Divya Sharma},
  journal= {arXiv preprint arXiv:2512.08012},
  year   = {2025}
}