中文

SurvBench:面向多模态电子健康记录生存分析的标准化预处理管道

机器学习 2026-05-13 v2

摘要

电子健康记录 (EHR) 数据的深度学习生存模型在论文之间难以进行比较,因为上游预处理步骤(包括队列定义、时间离散化、缺失值处理和 censoring 规则)通常未记录且不一致。因此,两个死亡模型之间的 concordance 差异可能反映这些选择的任何组合,而非模型贡献。我们提出了 SurvBench,一个开源预处理管道,将原始 PhysioNet 导出数据转换为生存分析模型就绪张量。SurvBench 涵盖四个关键 care 数据源(MIMIC-IV、eICU、MC-MED、HiRID)和四种输入模态:时间序列生命体征和实验室值、静态人口学特征、国际疾病分类 (ICD) 编码以及放射学报告嵌入。每个预处理决策均通过 YAML 配置文件控制。插值、缩放和特征过滤仅在训练折叠上拟合。缺失值以二值掩码形式记录在每个特征张量旁。该管道处理单风险终点(住院内死亡和 ICU 死亡)以及竞争风险终点(三条急诊室入院路径,其中家庭出院视为行政性 censoring)。我们还提供对 eICU 与 MIMIC-IV 之间进行调和化跨数据集外部验证的支持。SurvBench 已公开发布,链接为 https://github.com/munibmesinovic/SurvBench,为未来的深度学习 EHR 生存分析工作,尤其是新兴的多模态方法,在匹配的预处理下提供了可靠的衡量平台。

关键词

引用

@article{arxiv.2511.11935,
  title  = {SurvBench: A Standardised Preprocessing Pipeline for Multi-Modal Electronic Health Record Survival Analysis},
  author = {Munib Mesinovic and Tingting Zhu},
  journal= {arXiv preprint arXiv:2511.11935},
  year   = {2026}
}