中文

基于 GraphRAG 的临床概念自动 Curate 框架:用于 NLP 应用

计算与语言 2026-05-15 v2 人工智能

摘要

背景:临床命名实体识别工具常将自由文本映射到统一医学语言系统 (UMLS) 概念唯一标识符 (CUI)。然而,对于许多下游任务,临床有意义的单位并非单个 CUI,而是由相关同义词、子类型及关联概念组成的概念集合。构建这些集合耗时、执行不一致且缺乏现有工具的支持。方法:我们提出 CUICurate,一个基于图的检索增强生成 (GraphRAG) 框架,用于自动化 UMLS 概念集合 Curate。构建并嵌入 UMLS 知识图谱 (KG) 以进行语义检索。使用基于图的扩展方法检索候选 CUI,然后通过大型语言模型 (GPT-5 和 Qwen3-32B) 进行筛选和分类。对该框架在五个词汇异构临床概念上的表现进行了评估,使用手动 Curate 的概念集合和金标准概念集合进行比较。结果:CUICurate 产生的概念集合显著大于手动基准且更为完整。单个检索配置在概念之间实现了高召回率,同时保持可管理的候选集合。GPT-5 在所有概念中均优于手动 Curate,并保留至少 95% 的 definitive 金标准 CUI,而 Qwen3-32B 实现了可比但略低的性能。许多被遗漏的概念在 10,000 条 MIMIC-III 笔记中未被观察到。CUICurate 基础设施和端到端处理成本低廉且在多次运行中稳定可靠。结论:CUICurate 提供了一个可扩展、可复现且高性价比的解决方案,用于生成面向临床自然语言处理和表型学应用的临床医生可审查的 UMLS 概念集合。

关键词

引用

@article{arxiv.2602.17949,
  title  = {CUICurate: A GraphRAG-based Framework for Automated Clinical Concept Curation for NLP applications},
  author = {Victoria Blake and Jamie Novak and Mathew Miller and Sze-yuan Ooi and Blanca Gallego},
  journal= {arXiv preprint arXiv:2602.17949},
  year   = {2026}
}

备注

6 figures, 4 tables