中文

从临床叙事中学习基于偏好的目标以进行动态脓毒症治疗

人工智能 2026-05-26 v2 机器学习

摘要

在医疗保健领域为强化学习(RL)设计奖励函数仍然具有挑战性,因为具有临床意义的结果是稀疏、延迟且难以明确指定的。尽管结构化临床数据捕获了生理状态,但它们通常无法反映患者轨迹的更广泛方面,例如治疗反应、恢复动态和干预负担。相比之下,临床叙事编码了临床医生对疾病进展、治疗效果和恢复的纵向评估,为超越预定义结果指标的轨迹级监督提供了潜在来源。我们提出了临床叙事知情偏好奖励(CN-PR),这是一个通过将临床叙事视为轨迹级偏好的可扩展监督,直接从出院小结中学习奖励函数的框架。使用大型语言模型,我们推导出轨迹质量分数,并构建患者轨迹之间的成对偏好,以通过基于偏好的优化来学习奖励。为了考虑叙事信息量的可变性,我们引入了一个任务相关性信号,该信号根据监督与下游决策任务的相关性对其进行加权。我们使用离线RL在动态脓毒症治疗中评估了CN-PR。学习到的奖励与轨迹质量分数表现出强烈的单调对齐,并产生了与改善恢复相关结果相关的策略,包括增加无器官支持天数和更快的休克缓解,同时保持与基于结果的奖励基线相当的性能。这些发现在外部验证下得以保持。我们的结果表明,临床叙事为动态治疗方案中的奖励学习提供了可扩展且富有表现力的监督来源。

关键词

引用

@article{arxiv.2604.10783,
  title  = {Learning Preference-Based Objectives from Clinical Narratives for Dynamic Sepsis Treatment},
  author = {Daniel J. Tan and Jayne Hui Zhen Chan and Kai Wen Hwang and Arturo Yong Yao Neo and Kay Choong See and Mengling Feng},
  journal= {arXiv preprint arXiv:2604.10783},
  year   = {2026}
}