中文

面向目标区血糖控制的强化学习

机器学习 2025-08-07 v1

摘要

在临床安全目标区内管理生理变量是医疗领域的核心挑战,尤其是对于如1型糖尿病 Mellitus(T1DM)等慢性疾病。强化学习(RL)为个人化治疗提供了前景,但在处理干预的延迟和异质性效果方面存在挑战。我们提出了一种新颖的RL框架来研究和支持T1DM技术(如自动胰岛素输送)中的决策。我们的ethods方法通过统一两种控制模式:用于离散、快速作用干预(如胰岛素投药)的冲动控制,以及用于更长期的治疗和方案转换的切换控制。我们方法的核心是增强了生理状态特征的受限马尔可夫决策过程,使其能够在临床和资源约束条件下实现安全的策略学习。该框架包含生物学上真实的因素,包括胰岛素消解,导致所学策略更贴近实际的治疗行为。虽然本工作不旨在临床部署,但它为未来的安全和时序感知RL在医疗保健领域奠定了基础。我们提供了收敛性的理论保证,并在一个简化的T1DM控制任务中 demonstrate了经验性改进,将血糖水平违规率从22.4%(最先进方法)降低至最低10.8%。

关键词

引用

@article{arxiv.2508.03875,
  title  = {Reinforcement Learning for Target Zone Blood Glucose Control},
  author = {David H. Mguni and Jing Dong and Wanrong Yang and Ziquan Liu and Muhammad Salman Haleem and Baoxiang Wang},
  journal= {arXiv preprint arXiv:2508.03875},
  year   = {2025}
}