结合检索增强生成的大语言模型用于零样本疾病表型分析
人工智能
2023-12-12 v1 计算与语言
信息检索
摘要
从电子健康记录(EHR)中识别疾病表型对于许多二次用途至关重要。由于EHR编码不足,手动将医生知识编码为规则对于罕见疾病尤其具有挑战性,需要审查临床笔记。大语言模型(LLM)在文本理解方面有前景,但可能无法有效处理真实世界的临床文档。我们提出了一种基于零样本LLM的方法,通过检索增强生成和MapReduce增强,该方法预先识别与疾病相关的文本片段,并行用作LLM的查询以建立诊断。我们展示了该方法应用于肺动脉高压(PH)——一种以肺动脉压升高为特征的罕见疾病,显著优于医生逻辑规则(F1分数0.62 vs 0.75)。该方法有潜力增强罕见疾病队列识别,扩展稳健临床研究和护理差距识别的范围。
引用
@article{arxiv.2312.06457,
title = {Large Language Models with Retrieval-Augmented Generation for Zero-Shot Disease Phenotyping},
author = {Will E. Thompson and David M. Vidmar and Jessica K. De Freitas and John M. Pfeifer and Brandon K. Fornwalt and Ruijun Chen and Gabriel Altay and Kabir Manghnani and Andrew C. Nelsen and Kellie Morland and Martin C. Stumpe and Riccardo Miotto},
journal= {arXiv preprint arXiv:2312.06457},
year = {2023}
}
备注
Deep Generative Models for Health Workshop NeurIPS 2023