sEHR-CE:面向高效且可泛化患者队列扩展的结构化电子健康记录语言建模
计算与语言
2022-12-01 v1 机器学习
应用统计
摘要
电子健康记录(EHR)为深入临床表型分析和临床结局预测提供了前所未有的机遇。整合多种数据源对于生成疾病患病率、发病率和轨迹的完整图景至关重要。整合临床数据的标准方法涉及使用人工整理的映射在不同术语系统间收集临床术语,这些映射通常不准确和/或不完整。在此,我们提出 sEHR-CE,一种基于 transformer 的新框架,能够在不依赖这些映射的情况下实现异构临床数据集的整合表型分析与分析。我们利用概念的文本描述符统一临床术语,并将个体的 EHR 表示为文本段落。随后我们微调预训练语言模型,以比非文本和单一术语方法更准确地预测疾病表型。我们使用来自大规模研究 UK Biobank 的初级与次级保健数据验证了我们的方法。最后,我们在 2 型糖尿病用例中说明 sEHR-CE 如何识别无诊断但与患者具有共同临床特征的个体。
引用
@article{arxiv.2211.17121,
title = {sEHR-CE: Language modelling of structured EHR data for efficient and generalizable patient cohort expansion},
author = {Anna Munoz-Farre and Harry Rose and Sera Aylin Cakiroglu},
journal= {arXiv preprint arXiv:2211.17121},
year = {2022}
}
备注
Workshop on Learning from Time Series for Health, 36th Conference on Neural Information Processing Systems (NeurIPS 2022). arXiv admin note: text overlap with arXiv:2202.09318