Can-SAVE:基于生存分析变量与电子健康记录开展低成本、人口规模的癌症筛查
机器学习
2026-04-29 v4 人工智能
应用统计
摘要
传统的医学癌症筛查方法成本高、劳动密集且极难规模化。尽管人工智能(AI)可改善癌症检测,但多数系统依赖复杂或专门的医疗数据,难以用于大规模筛查。我们提出 Can-SAVE,一种仅基于病史事件对全人群癌症风险进行排序的轻量级 AI 系统。通过将生存模型输出整合进梯度提升框架,我们的方法能检测到细微、长期的患者风险模式——往往远在临床症状显现之前。Can-SAVE 在跨越俄罗斯五个地区、涵盖 250 万成年人的真实世界数据集上进行了严格评估,使本研究成为规模最大、最全面的 AI 驱动癌症风险评估部署之一。在一项针对 190 万患者的回顾性、肿瘤科医生监督研究中,Can-SAVE 在相同筛查量下实现了比最佳基线(通过 DeepSeek-R1 摘要的 LoRA 微调 Qwen3-Embeddings)高 4–10 倍的检出率,且平均精度(AP)为 0.228,而最佳基线为 0.193。在为期一年的前瞻性试点(42.6 万患者)中,我们的方法使癌症检出率几乎翻倍(+91%),并使人口覆盖率比国家筛查方案提高 36%。该系统展现出实际可扩展性:使用标准硬件可在三小时内处理 100 万患者的全市人口,从而实现无缝临床集成。本工作证明,Can-SAVE 在遵循真实世界公共医疗约束的同时,实现了具有国家意义的癌症检测改进,提供了即时临床效用以及可复制的人口规模筛查框架。训练与特征工程代码见 https://github.com/sb-ai-lab/Can-SAVE。
引用
@article{arxiv.2309.15039,
title = {Can-SAVE: Deploying Low-Cost and Population-Scale Cancer Screening via Survival Analysis Variables and EHR},
author = {Petr Philonenko and Vladimir Kokh and Pavel Blinov},
journal= {arXiv preprint arXiv:2309.15039},
year = {2026}
}
备注
Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)