基于大语言模型的罕见病表型分析混合框架
计算与语言
2024-11-12 v3
摘要
罕见病由于其低患病率和异质性临床表现,在诊断和治疗方面面临重大挑战。非结构化临床记录包含识别罕见病的有价值信息,但手动整理耗时且易受主观性影响。本研究旨在开发一种混合方法,将基于词典的自然语言处理工具与大语言模型相结合,以改进从非结构化临床报告中识别罕见病。我们提出了一种新颖的混合框架,整合了Orphanet罕见病本体和统一医学语言系统,以创建全面的罕见病词汇表。所提出的混合方法相比传统自然语言处理系统和独立的大语言模型表现出更优的性能。值得注意的是,该方法发现了大量未在结构化诊断记录中记录的潜在罕见病病例,突显了其识别先前未被识别的患者的能力。
引用
@article{arxiv.2405.10440,
title = {A Hybrid Framework with Large Language Models for Rare Disease Phenotyping},
author = {Jinge Wu and Hang Dong and Zexi Li and Haowei Wang and Runci Li and Arijit Patra and Chengliang Dai and Waqar Ali and Phil Scordis and Honghan Wu},
journal= {arXiv preprint arXiv:2405.10440},
year = {2024}
}