学习压缩至控制时间:一种用于慢性病管理的强化学习框架
机器学习
2026-05-12 v1
摘要
医疗保健领域的强化学习(RL)效果不一,奖励稀疏、不可靠的离线策略评估以及部署-模拟差距是反复出现的失败模式。我们认为,在结构上,慢性病管理比该领域主要研究的急性护理问题是一个更易处理的 RL 设定,但前提是问题的形式化必须能够利用慢性护理的特性。我们提出了这样一种形式化。智能体的目标是在根据 CMS ACCESS 模型校准的分层奖励下压缩至控制时间(TTC)。我们配套偏好学习论文 [Singh et al. 2026] 中的两个量作为承重结构元素:执行强度 在受约束马尔可夫决策过程下限制动作可用性,而临床医生能力 在 RL 训练期间对离线数据转移进行加权。它们共同将偏好学习和 RL 耦合为一个双循环架构。我们展示了在用于高血压和 2 型糖尿病的合成状态机上的模拟结果。在 T2D TTC 上,能力加权的离线 RL 比均匀加权的离线 RL 和行为策略高出 15 个百分点;均匀加权公式(现有医疗保健 RL 中的标准做法)的表现甚至不如异构行为策略。 感知策略可以跨部署机制泛化,而 朴素策略则不能。
引用
@article{arxiv.2605.09818,
title = {Learning to Compress Time-to-Control: A Reinforcement Learning Framework for Chronic Disease Management},
author = {Prabhjot Singh and Abhishek Gupta and Chris Betz and Abe Flansburg and Brett Ives and Sudeep Lama and Jung Hoon Son},
journal= {arXiv preprint arXiv:2605.09818},
year = {2026}
}
备注
26 pages, 3 figures