利用 EHR 数据进行 5 年慢性病队列预测的大型语言多模态模型
计算与语言
2024-09-02 v2 人工智能
摘要
糖尿病等慢性病是全球发病率和死亡率的主要原因。许多研究尝试使用各种深度学习模型进行诊断。然而,以往的大多数研究存在一定的局限性,包括使用公开可用的数据集(如 MIMIC)以及数据不平衡。在本研究中,我们从台湾医院数据库收集了为期五年的电子健康记录(EHR),包括 1,420,596 份临床笔记、387,392 份实验室检测结果以及超过 1,505 个实验室检测项目,专注于预训练大型语言模型的研究。我们提出了一种新型的大型语言多模态模型(LLMMs)框架,该框架结合了来自临床笔记和实验室检测结果的多模态数据,用于预测慢性病风险。我们的方法结合了文本嵌入编码器和多头注意力层来学习实验室检测值,利用深度神经网络(DNN)模块将血液特征与慢性病语义融合到潜在空间中。在我们的实验中,我们观察到 clinicalBERT 和 PubMed-BERT 在与注意力融合相结合时,在多类慢性病和糖尿病预测中可以达到 73% 的准确率。通过将实验室检测值转换为文本描述并采用 Flan T-5 模型,我们实现了 76% 的 ROC 曲线下面积(AUROC),证明了利用数值文本数据进行语言模型训练和推理的有效性。该方法显著提高了早期糖尿病预测的准确性。
引用
@article{arxiv.2403.04785,
title = {Large Language Multimodal Models for 5-Year Chronic Disease Cohort Prediction Using EHR Data},
author = {Jun-En Ding and Phan Nguyen Minh Thao and Wen-Chih Peng and Jian-Zhe Wang and Chun-Cheng Chug and Min-Chen Hsieh and Yun-Chien Tseng and Ling Chen and Dongsheng Luo and Chi-Te Wang and Pei-fu Chen and Feng Liu and Fang-Ming Hung},
journal= {arXiv preprint arXiv:2403.04785},
year = {2024}
}