中文

基于人类反馈的灵活血糖控制:离线强化学习

人工智能 2025-01-28 v1 机器学习

摘要

强化学习(RL)在模拟类型 1 糖尿病(T1D)患者的胰岛素剂量自动化方面取得了成功,但目前无法融合患者的专业知识和偏好。本工作提出了 PAINT(Preference Adaptation for INsulin control in T1D,针对 T1D 的偏好适应胰岛素控制)框架,这是一种从患者记录中学习灵活胰岛素剂量策略的原创RL方法。PAINT采用草图化方法进行奖励学习,对历史数据进行标注,以反映患者期望的结果。标注数据用于训练奖励模型,为 novel safety-constrained offline RL 算法提供指导。该算法设计受限于安全策略,支持通过滑块式比例进行偏好调节。在仿真评估中,PAINT通过简单的数据标注实现常规血糖目标,较商业基准方案降低 15% 的血糖风险。动作标注还可用于融合患者专业知识,展示了在患者指导下预empt 餐后(餐后时间范围提升 10%)以及解决某些设备故障(故障后方差降低 1.6%)的能力。这些结果在现实条件下同样成立,包括样本有限、标注错误以及患者间变异性。本工作说明了 PAINT 在实际 T1D 管理中以及更广泛需要在安全约束下进行快速精确偏好学习的任务中的潜力。

关键词

引用

@article{arxiv.2501.15972,
  title  = {Flexible Blood Glucose Control: Offline Reinforcement Learning from Human Feedback},
  author = {Harry Emerson and Sam Gordon James and Matthew Guy and Ryan McConville},
  journal= {arXiv preprint arXiv:2501.15972},
  year   = {2025}
}

备注

11 pages, 5 figures