多模态数据至关重要:基于结构化与非结构化电子健康记录的语言模型预训练
计算与语言
2022-11-01 v7 机器学习
摘要
作为电子健康记录(EHR)中两种重要的文本模态,结构化数据(临床代码)和非结构化数据(临床叙述)近来日益被应用于医疗保健领域。然而,大多数现有的面向EHR的研究要么专注于某一特定模态,要么以直接的方式整合来自不同模态的数据,这通常将结构化和非结构化数据视为关于患者入院的两种独立信息源,并忽略了它们之间的内在交互。事实上,这两种模态是在同一次诊疗过程中记录的,其中结构化数据为非结构化数据的记录提供信息,反之亦然。在本文中,我们提出了一种医学多模态预训练语言模型,名为MedM-PLM,旨在学习基于结构化和非结构化数据的增强型EHR表示,并探索两种模态的交互。在MedM-PLM中,首先采用两个基于Transformer的神经网络组件从每种模态中学习代表性特征。然后引入一个跨模态模块来建模它们的交互。我们在MIMIC-III数据集上预训练了MedM-PLM,并在三个下游临床任务(即药物推荐、30天再入院预测和ICD编码)上验证了模型的有效性。大量实验证明了MedM-PLM与最先进方法相比的强大能力。进一步的分析和可视化显示了我们模型的鲁棒性,这可能为临床决策提供更全面的解释。
引用
@article{arxiv.2201.10113,
title = {Multimodal data matters: language model pre-training over structured and unstructured electronic health records},
author = {Sicen Liu and Xiaolong Wang and Yongshuai Hou and Ge Li and Hui Wang and Hui Xu and Yang Xiang and Buzhou Tang},
journal= {arXiv preprint arXiv:2201.10113},
year = {2022}
}
备注
12 pages, 5 figures accepted for publication in the IEEE Journal of Biomedical and Health Informatics (J-BHI)