电子健康记录多模态分析的对比学习
机器学习
2025-08-20 v2 机器学习
摘要
电子健康记录(EHR)系统包含丰富的多模态临床数据,包括结构化数据(如临床代码)和非结构化数据(如临床笔记)。然而,许多现有的专注于EHR的研究传统上要么集中于单一模态,要么以相当初级的方式合并不同模态。这种方法通常将结构化和非结构化数据视为独立的实体,忽略了它们之间固有的协同作用。具体而言,这两种重要模态包含临床相关的、不可分割且互补的健康信息。通过对这两种数据模态的联合分析,可以捕捉到患者病史更完整的图景。尽管多模态对比学习在视觉-语言领域取得了巨大成功,但其在多模态EHR领域的潜力仍未被充分探索,特别是在其理论理解方面。为了适应多模态EHR数据的统计分析,本文提出了一种新颖的多模态特征嵌入生成模型,并设计了一种多模态对比损失以获取多模态EHR特征表示。我们的理论分析证明了多模态学习相比单模态学习的有效性,并将损失函数的解与点互信息矩阵的奇异值分解联系起来。这种联系为针对多模态EHR特征表示学习量身定制的隐私保护算法铺平了道路。仿真研究表明,所提出的算法在各种配置下均表现良好。我们进一步在真实世界的EHR数据中验证了所提出算法的临床实用性。
引用
@article{arxiv.2403.14926,
title = {Contrastive Learning on Multimodal Analysis of Electronic Health Records},
author = {Tianxi Cai and Feiqing Huang and Ryumei Nakada and Linjun Zhang and Doudou Zhou},
journal= {arXiv preprint arXiv:2403.14926},
year = {2025}
}
备注
34 pages