使用LLM从结构化提取真实世界医学知识用于摘要与检索
计算与语言
2024-12-23 v1 人工智能
机器学习
摘要
知识图谱的创建和精选可加速真实世界数据的疾病发现与分析。虽然疾病本体有助于生物学数据注释,但编码类别(如SNOMED-CT、ICD10、CPT)可能无法捕捉患者病情细微差异或罕见疾病。来自不同数据源的多种疾病定义会使本体映射和疾病聚类复杂化。我们提出使用大语言模型提取技术创建患者知识图谱,允许通过自然语言而非僵化的本体层次结构进行数据提取。该方法映射到现有本体(MeSH、SNOMED-CT、RxNORM、HPO),以为提取实体提供支撑。我们使用包含3360万患者的大型门诊护理EHR数据库演示了该方法,通过为Dravet综合征(该综合征于2020年10月获ICD10认可)进行患者检索来展示。我们描述了患者特定知识图谱和症状基于患者检索的构建。我们以确认Dravet综合征ICD10代码为真实情况,运用LLM基于实体提取来描述基于支撑本体中的患者。随后,我们将该方法应用于识别无真实情况的Beta-转子蛋白相关神经退行性疾病(BPAN)患者,展示了在无真实情况情境下的真实世界发现。
引用
@article{arxiv.2412.15256,
title = {Structured Extraction of Real World Medical Knowledge using LLMs for Summarization and Search},
author = {Edward Kim and Manil Shrestha and Richard Foty and Tom DeLay and Vicki Seyfert-Margolis},
journal= {arXiv preprint arXiv:2412.15256},
year = {2024}
}
备注
10 pages, 3 figures, Work published in 4th Workshop on Knowledge Graphs and Big Data (In Conjunction with IEEE Big Data 2024)