中文

基于强化学习的电子健康记录标签高效主动分型框架

机器学习 2025-11-25 v2 计算机与社会

摘要

目标:电子健康记录 (EHR) 分型常依赖噪声代理标签,这会削弱下游风险预测的可靠性。主动学习可降低标注成本,但大多数方法依赖固定的启发式规则,且无法确保分型细化后能提升预测性能。我们的目标是开发一个框架,直接利用下游预测性能作为反馈,指导在受限标注预算下进行分型纠正和样本选择。材料与方法:我们提出了强化学习增强的标签高效主动分型框架 (RELEAP)。RELEAP 能够自适应整合多种查询策略,不同于先前方法,RELEAP 根据下游模型的反馈更新其策略。我们在 Duke University Health System (DUHS) 的 de-identified 数据集(覆盖 2014-2024 年)上评估了 RELEAP,用于肺癌风险预测,使用逻辑回归和惩罚性 Cox 生存模型进行评估。将其性能与噪声标签基线和单一策略主动学习方法进行基准比较。结果:RELEAP 在所有基线方法中均表现出色。逻辑回归 AUC 从 0.774 提升至 0.805,生存 C-index 从 0.718 提升至 0.752。在相同标注预算下,RELEAP 利用下游性能作为反馈,比启发式方法更平滑、更稳定。讨论:通过将分型细化与预测结果关联,RELEAP 学习到了哪些样本最能提升下游判别与校准能力,为固定主动学习规则提供了更原则的方法。结论:RELEAP 通过下游反馈优化分型纠正,提供了一个可扩展、标签高效的范式,显著降低了人工病历审阅的需求,并提升了基于 EHR 的风险预测可靠性。

关键词

引用

@article{arxiv.2511.07473,
  title  = {RELEAP: Reinforcement-Enhanced Label-Efficient Active Phenotyping for Electronic Health Records},
  author = {Yang Yang and Kathryn I. Pollak and Bibhas Chakraborty and Molei Liu and Doudou Zhou and Chuan Hong},
  journal= {arXiv preprint arXiv:2511.07473},
  year   = {2025}
}

备注

20 pages, 5 figures, 1 table. Includes supplementary material. Submitted to JAMIA Open. {\dag} These authors contributed equally. *Corresponding author: Chuan Hong