探索2型糖尿病微血管并发症的长期预测
机器学习
2024-12-03 v1 计算与语言
摘要
电子医疗记录(EHR)包含大量数据,可支持临床结果的预测。EHR数据通常使用临床代码(ICD10、SNOMED)存储和分析,但这些代码在不同注册中心和医疗提供者之间可能不同。跨系统集成数据涉及不同临床本体之间的映射,需要领域专业知识,有时会导致数据丢失。为克服这一点,已提出代码无关模型。我们评估了代码无关表示方法在2型糖尿病患者长期微血管并发症预测任务上的有效性。我们的方法使用微调后的预训练临床语言模型将个体EHR编码为文本。利用来自英国的大规模EHR数据,我们采用多标签方法同时预测1年、5年和10年窗口内微血管并发症的风险。我们证明代码无关方法优于基于代码的模型,并表明预测窗口越长性能越好,但偏向于首次发生的并发症。总体而言,我们强调上下文长度对模型性能至关重要。这项研究突出了整合来自不同临床本体数据的可能性,是通用临床模型的起点。
引用
@article{arxiv.2412.01331,
title = {Exploring Long-Term Prediction of Type 2 Diabetes Microvascular Complications},
author = {Elizabeth Remfry and Rafael Henkin and Michael R Barnes and Aakanksha Naik},
journal= {arXiv preprint arXiv:2412.01331},
year = {2024}
}
备注
Findings paper presented at Machine Learning for Health (ML4H) symposium 2024, December 15-16, 2024, Vancouver, Canada, 9 pages