可扩展早期癌症检测:评估基于 EHR 的预测模型对比传统筛查标准
机器学习
2026-01-27 v2 定量方法
摘要
当前癌症筛查指南仅覆盖少数癌症类型,依赖年龄或如吸烟史等单一风险因素等狭窄标准来识别高风险人群。使用电子健康记录(EHR)的预测模型能捕获大规模的、患者水平的纵向健康信息,可能为识别高风险群体提供更有效的工具,通过检测癌症的前诊断信号来实现这一目标。近期在大语言模型和基础模型方面的进展进一步扩充了这一潜力,但关于 EHR 基于模型在实际应用中如何有用,尚缺乏证据。我们系统评估了 EHR 基于模型的临床实用性,针对八种主要癌症(乳腺癌、肺癌、结直肠癌、前列腺癌、卵巢癌、肝癌、胰腺癌和胃癌),将其与传统风险因素(包括基因突变和家族癌症史)进行比较,利用来自 All of Us 研究计划的数据(该计划整合了来自 865,000 多名参与者的 EHR、基因组和调查数据)。即使采用基线建模方法,EHR 基于模型在传统风险因素单独或辅助使用的情形下,还能将真实癌症病例的富集率提高 3 至 6 倍。EHR 基础模型——一种在全面患者轨迹上进行训练的先进方法——在 26 种癌症类型上进一步提升了预测性能,证明了 EHR 基于预测建模在支持更精确和可扩展的早期检测策略方面的临床潜力。
关键词
引用
@article{arxiv.2511.11293,
title = {Toward Scalable Early Cancer Detection: Evaluating EHR-Based Predictive Models Against Traditional Screening Criteria},
author = {Jiheum Park and Chao Pang and Tristan Y. Lee and Jeong Yun Yang and Jacob Berkowitz and Alexander Z. Wei and Nicholas Tatonetti},
journal= {arXiv preprint arXiv:2511.11293},
year = {2026}
}