结合领域特定模型与 LLM 从调查数据中自动进行疾病表型分析
计算与语言
2024-12-23 v2
摘要
这项探索性试点研究调查了将领域特定模型 BERN2 与大语言模型(LLM)相结合的潜力,以增强从研究调查数据中自动进行疾病表型分析的能力。出于对高效且准确的方法以将日益增长的调查数据与标准化疾病本体相协调的需求,我们采用了 BERN2(一种生物医学命名实体识别与归一化模型)从 ORIGINS 出生队列调查数据中提取疾病信息。在根据人工整理的真实数据集严格评估 BERN2 的性能后,我们使用提示工程、检索增强生成(RAG)和指令微调(IFT)集成了各种 LLM,以优化模型的输出。BERN2 在提取和归一化疾病提及方面表现出高性能,而 LLM 的集成,特别是结合 Few Shot Inference 和 RAG 编排,进一步提高了准确性。这种方法,特别是当结合结构化示例、逻辑推理提示和详细上下文时,为开发能够在大型异构研究数据集上实现高效队列分析和数据协调的工具提供了一条有前景的途径。
引用
@article{arxiv.2410.20695,
title = {Combining Domain-Specific Models and LLMs for Automated Disease Phenotyping from Survey Data},
author = {Gal Beeri and Benoit Chamot and Elena Latchem and Shruthi Venkatesh and Sarah Whalan and Van Zyl Kruger and David Martino},
journal= {arXiv preprint arXiv:2410.20695},
year = {2024}
}