中文

基于患者群体图的无监督预训练用于患者级预测

机器学习 2022-06-10 v2

摘要

预训练在机器学习不同领域已显示出成功,如计算机视觉(CV)、自然语言处理(NLP)和医学影像。然而,它在临床数据分析中尚未被充分探索。尽管记录了海量电子健康记录(EHR)数据,但如果数据是在小型医院收集或涉及罕见疾病,数据和标签可能稀缺。在此类场景中,在更大的EHR数据集上预训练可改善模型性能。本文中,我们将无监督预训练应用于异构多模态EHR数据以进行患者结局预测。为对该数据建模,我们利用群体图上的图深度学习。我们首先设计了一种基于图变换器的网络架构,旨在处理EHR数据中出现的各种输入特征类型,如连续、离散和时间序列特征,从而实现更好的多模态数据融合。此外,我们设计了基于掩码插补的预训练方法,以在不同端任务微调之前预训练我们的网络。预训练以完全无监督的方式进行,这为未来在具有不同任务和相似模态的大型公共数据集上预训练奠定了基础。我们在两个患者记录医学数据集TADPOLE和MIMIC-III上测试了我们的方法,包括影像与非影像特征以及不同预测任务。我们发现,我们提出的基于图的预训练方法有助于在群体水平上对数据建模,并进一步在微调任务上平均将AUC提升4.15%(MIMIC)和7.64%(TADPOLE)。

关键词

引用

@article{arxiv.2203.12616,
  title  = {Unsupervised Pre-Training on Patient Population Graphs for Patient-Level Predictions},
  author = {Chantal Pellegrini and Anees Kazi and Nassir Navab},
  journal= {arXiv preprint arXiv:2203.12616},
  year   = {2022}
}

备注

10 pages, 1 figure, 3 tables