中文

适配预训练语言模型以解决电子健康记录中的表格预测问题

计算与语言 2023-03-28 v1 机器学习

摘要

我们提出了一种利用领域自适应将 DeBERTa 模型适配于电子健康记录(EHR)任务的方法。我们在一个由 MIMIC-III 出院小结、临床笔记、放射学报告和 PubMed 摘要组成的数据集上预训练了一个小型 DeBERTa 模型。我们将该模型的性能与在我们机构 EHR(MeDeBERTa)的临床文本上预训练的 DeBERTa 模型以及 XGBoost 模型进行比较。我们使用 MIMIC-IV-ED 数据集在三个急诊科结局的基准任务上评估性能。我们对数据进行预处理以将其转换为文本格式,并生成原始数据集的四个版本以比较数据处理与数据纳入方式。结果表明,我们提出的方法在三个任务中的两个上优于其他替代模型(p<0.001),并在第三个任务上性能相当,且使用描述性列相比原始列名提升了性能。

关键词

引用

@article{arxiv.2303.14920,
  title  = {Adapting Pretrained Language Models for Solving Tabular Prediction Problems in the Electronic Health Record},
  author = {Christopher McMaster and David FL Liew and Douglas EV Pires},
  journal= {arXiv preprint arXiv:2303.14920},
  year   = {2023}
}