罕见结果情境下弱监督电子健康记录基于表型方法的性能
统计方法学
2026-04-14 v1 机器学习
摘要
准确识别具有特定医疗条件的患者是使用电子健康记录中的临床数据面临的关键挑战。我们的目标是全面评估在罕见结果情境下(如疫苗安全性研究中),使用银标准标签(真实结果的代理措施)而非金标准真实标签的弱监督预测方法何时表现良好。我们通过大规模模拟研究比较了三种方法(PheNorm、MAP 和 sureLDA),这些方法结合了结构化特征和从临床文本中派生的特征使用自然语言处理。模拟研究的数据生成机制从简单到复杂,结果率变化,银标签信息程度变化。我们还考虑使用预测概率来设计图表审核验证研究。没有单一方法在所有预测性能指标上都占据优势。概率导向的抽样选择了更多重要概念在图表注释中出现的患者队列。sureLDA,这是我们考虑的三种算法中最复杂的算法,在模拟研究中常常表现良好。性能很大程度上取决于所选的调优参数。应谨慎在罕见结果情境下使用弱监督预测方法,特别是如果概率将用于下游分析,但这些方法在银标签是真实结果的强预测器时可以工作得很好。
引用
@article{arxiv.2604.09913,
title = {Performance of weakly-supervised electronic health record-based phenotyping methods in rare-outcome settings},
author = {Yunjing Hong and Jennifer C. Nelson and Brian D. Williamson},
journal= {arXiv preprint arXiv:2604.09913},
year = {2026}
}
备注
58 pages, 4 main figures, 3 supplemental figures, 4 main tables, 17 supplemental tables