EveryQuery:基于电子健康记录的零样本临床预测
人工智能
2026-05-19 v2
摘要
基于电子健康记录 (EHR) 预训练的基础模型已通过生成合成患者未来并聚合样本轨迹上的统计信息,展示了零样本临床预测能力。然而,这种自回归推理过程计算昂贵、统计噪声大,且不具原生可提示性,因为用户无法直接对特定临床问题进行条件化。在本初步工作中,我们引入 EveryQuery,一种通过任务条件化预训练实现零样本推理的 EHR 基础模型。不同于生成未来事件,EveryQuery 以患者历史和指定临床任务的结构化查询作为输入,直接通过单次前向传播估计未来窗口内结果发生的概率。EveryQuery 通过对随机抽取的查询任务和患者情境组合进行预训练,实现了该能力,使模型被训练以正确回答任意输入提示。这一能力使我们无需微调、线性探测或轨迹生成,即可对查询空间中的任何任务实现零样本预测。在 MIMIC-IV 上,EveryQuery 在 39 个随机抽取的预测任务中,以 82% 的优势超过自回归基线,平均 AUC 提升 +0.16(95% 置信区间:[0.10, 0.22])。该优势在明确保留用于测试的任务上也得以维持。进一步地,EveryQuery 的性能提升在罕见临床事件上最为显著,确认并展示了解决自回归推理在低患病率结果上固有局限性的方案。然而,当前 EveryQuery 在需要对多个代码进行析取推理的任务(如 30 天读mission)上表现不佳,暴露了当前查询语言的可表达性局限。
引用
@article{arxiv.2603.07900,
title = {EveryQuery: Zero-Shot Clinical Prediction via Task-Conditioned Pretraining over Electronic Health Records},
author = {Payal Chandak and Gregory Kondas and Liat Antwarg Friedman and Isaac Kohane and Matthew McDermott},
journal= {arXiv preprint arXiv:2603.07900},
year = {2026}
}