基于临床笔记提取概念的不同表示模型在死亡率预测中的评估
计算与语言
2022-07-25 v1 信息检索
机器学习
摘要
近年来,利用电子病历(EMRs)进行二次用途以提升医疗服务质量和安全性的兴趣尤为浓厚。EMRs往往包含大量有价值的临床笔记。嵌入学习是一种将笔记转换为可比较格式的方法。基于Transformer的表示模型最近取得了巨大飞跃,这些模型在大型在线数据集上预训练以有效理解自然语言文本。学习嵌入的质量受临床笔记作为表示模型输入的使用方式影响。临床笔记具有多个信息价值不同的部分,且医疗提供者常用不同表达指代同一概念也是常见现象。现有方法直接使用临床笔记或经初始预处理后作为表示模型的输入。然而,为学习良好嵌入,我们识别了最关键的临床笔记部分,然后将所选部分中提取的概念映射到统一医学语言系统(UMLS)中的标准名称,并使用对应唯一概念的标准短语作为临床模型的输入。我们在公开可用的重症监护医学信息集市(MIMIC-III)数据集的一个子集上进行了实验,以衡量所学嵌入向量在院内死亡率预测任务中的有用性。根据实验,基于临床Transformer的表示模型以提取唯一概念的标准名称生成的输入相比其他输入格式产生了更好的结果。表现最佳的模型依次为BioBERT、PubMedBERT和UmlsBERT。
引用
@article{arxiv.2207.10872,
title = {Assessing mortality prediction through different representation models based on concepts extracted from clinical notes},
author = {Hoda Memarzadeh and Nasser Ghadiri and Maryam Lotfi Shahreza},
journal= {arXiv preprint arXiv:2207.10872},
year = {2022}
}