中文

MIMIC-IV-Ext-PE:使用大型语言模型预测 MIMIC-IV 数据集中的肺栓塞表型

计算与语言 2024-11-04 v1 机器学习

摘要

肺栓塞 (PE) 是可预防的院内死亡的主要原因。诊断、风险分层和预防方面的进步可以改善预后。目前,用于研究且包含 PE 标签的大型公开数据集很少。利用 MIMIC-IV 数据库,我们提取了所有可用的计算机断层扫描肺动脉造影 (CTPA) 放射学报告,并由两名医生手动将结果标记为 PE 阳性(急性 PE)或 PE 阴性。然后,我们应用先前微调的 Bio_ClinicalBERT 变换器语言模型 VTE-BERT 来自动提取标签。我们通过测量其与人工判定的性能对比,验证了 VTE-BERT 的可靠性。我们还将 VTE-BERT 的性能与诊断代码进行了比较。我们发现,在急诊室和/或入院的所有 19,942 名有 CTPA 放射学报告的患者中,VTE-BERT 的灵敏度为 92.4%,阳性预测值 (PPV) 为 87.8%。相比之下,在 11,990 名有出院诊断代码的住院患者子集中,诊断代码的灵敏度为 95.4%,PPV 为 83.8%。我们成功地为公开数据集中的 CTPA 添加了近 20,000 个标签,并证明了半监督语言模型在加速血液学研究中的外部有效性。

关键词

引用

@article{arxiv.2411.00044,
  title  = {MIMIC-IV-Ext-PE: Using a large language model to predict pulmonary embolism phenotype in the MIMIC-IV dataset},
  author = {B. D. Lam and S. Ma and I. Kovalenko and P. Wang and O. Jafari and A. Li and S. Horng},
  journal= {arXiv preprint arXiv:2411.00044},
  year   = {2024}
}