基于大型语言模型的医学概念文本属性知识图谱扩展
机器学习
2026-05-05 v2
摘要
在电子健康记录(EHR)挖掘中,学习医学概念(如标准化诊断、药物和手术代码)的高质量表征是下游临床预测任务的基础。然而,现有本体资源常缺失或不完整地包含临床上重要的跨类型依赖(如诊断-药物、药物-手术关系),限制了对复杂 EHR 模式的建模;此外,结构化资源中常缺乏丰富的临床语义信息,亦或即便存在文本形式的语义信息,也难以与知识图谱结构有效集成以进行表征学习。为此,我们提出 MedCo——一个由大型语言模型(LLM)驱动的医学概念表征学习框架。MedCo 首先通过结合从 EHR 中挖掘出的统计可靠关联及基于类型约束的 LLM 提示推断语义关系,构建覆盖医学代码的全局知识图谱(KG)。随后利用 LLM 生成节点描述与边缘理由,将 KG 扩展为带文本属性的图谱,为概念及其关系提供语义信号。最后,MedCo 采用 LoRA 微调的 LLaMA 文本编码器联合异构图神经网络(GNN),将文本语义与图结构融合为统一的概念嵌入。大量实验表明,MedCo 在 MIMIC-III 和 MIMIC-IV 数据集上均显著提升了预测性能,充分发挥作为标准 EHR 流水线的有效插件式概念编码器的作用。
引用
@article{arxiv.2604.13331,
title = {Text-Attributed Knowledge Graph Enrichment with Large Language Models for Medical Concept Representation},
author = {Mohsen Nayebi Kerdabadi and Arya Hadizadeh Moghaddam and Chen Chen and Dongjie Wang and Zijun Yao},
journal= {arXiv preprint arXiv:2604.13331},
year = {2026}
}
备注
This paper has been accepted at ACL 2026 main conference