LLM-MINE:基于大语言模型的阿尔茨海尔病及相关痴呆表型从临床笔记中挖掘
人工智能
2026-03-17 v1 机器学习
摘要
从电子健康记录(EHR)中准确提取阿尔茨海尔病及相关痴呆(ADRD)表型,对早期检测和疾病分期至关重要。然而,这些信息通常嵌入非结构化文本中,而非表格数据,导致提取困难。为此,我们提出 LLM-MINE,一个基于大语言模型的表型挖掘框架,用于从临床笔记中自动提取 ADRD 表型。我们使用两个专家定义的表型列表,对提取的表型进行评估,通过检验其在不同队列之间的统计显著性及其用于无监督疾病分期的实用性。卡方检验确认了不同队列之间表型差异具有统计显著性,其中记忆受损是最强的区分因子。以组合表型列表进行的 few-shot 提示 achieving the best clustering performance(ARI=0.290, NMI=0.232),显著优于生物医学命名实体识别和词典基准方法。我们的结果表明,基于大语言模型的表型提取是一个从非结构化笔记中发现临床上有意义 ADRD 信号的有前景的工具。
引用
@article{arxiv.2603.13673,
title = {LLM-MINE: Large Language Model based Alzheimer's Disease and Related Dementias Phenotypes Mining from Clinical Notes},
author = {Mingchen Shao and Yuzhang Xie and Carl Yang and Jiaying Lu},
journal= {arXiv preprint arXiv:2603.13673},
year = {2026}
}