中文

多模态训练到单模态部署:利用非结构化数据优化仅结构化数据部署

机器学习 2026-03-25 v1

摘要

非结构化电子健康记录(EHR)数据,如临床笔记,包含未直接体现在结构化数据字段中的临床上下文观察。这种额外信息可显著提升模型学习。然而,由于其非结构化特性,这些数据在部署模型时往往不可用或不实用。我们提出一种多模态学习框架,在训练期间利用非结构化 EHR 数据,但生成仅使用结构化 EHR 数据可部署的模型。我们采用 3,466 名评估迟迟说话儿童的队列,利用 BioClinicalBERT 生成笔记嵌入,并从人口统计信息和医学代码中编码结构化嵌入。一种基于笔记的教师模型和一种仅使用结构化数据的学生模型通过对比学习和对比知识蒸馏损失联合训练,产生一个强大的分类器(AUROC=0.985)。我们提出的模型达到 AUROC=0.705,优于仅使用结构化数据的基线模型 0.656。这些结果表明,在训练期间整合非结构化数据可增强模型识别结构化 EHR 数据中任务相关信息的能力,使可部署的仅结构化数据表型模型具备更强的辨识能力。

关键词

引用

@article{arxiv.2603.22530,
  title  = {Multimodal Training to Unimodal Deployment: Leveraging Unstructured Data During Training to Optimize Structured Data Only Deployment},
  author = {Zigui Wang and Minghui Sun and Jiang Shu and Matthew M. Engelhard and Lauren Franz and Benjamin A. Goldstein},
  journal= {arXiv preprint arXiv:2603.22530},
  year   = {2026}
}

备注

10 pages,3 figures