Zebra-Llama:一种用于普及罕见病知识的上下文感知大语言模型
计算与语言
2024-11-06 v1
摘要
罕见病在医疗保健领域带来了独特的挑战,常常面临诊断延迟和信息碎片化的问题。这些病症可靠知识的稀缺,对大语言模型(LLM)在支持临床管理和提供精确患者信息方面构成了独特的挑战,凸显了对这些“斑马”病例进行针对性训练的必要性。我们提出了Zebra-Llama,一种专门的上下文感知语言模型,具有高精度的检索增强生成(RAG)能力,并以埃勒斯-当洛斯综合征(EDS)作为我们的案例研究。EDS影响每5000人中的1人,以其多样的症状、多种亚型和不断演变的诊断标准,体现了罕见病的复杂性。通过实施一种新颖的上下文感知微调方法,该方法基于从医学文献、患者经验和临床资源中提取的问题以及专家策划的答案进行训练,Zebra-Llama在处理EDS相关查询方面展现了前所未有的能力。在一个从EDS患者和临床医生处收集的真实世界问题测试集上,医学专家评估了两个模型生成的回答,结果显示Zebra-Llama在全面性(77.5%对70.1%)、准确性(83.0%对78.8%)、清晰度(74.7%对72.0%)和引用可靠性(70.6%对52.3%)方面相比基础模型(Llama 3.1-8B-Instruct)有显著提升。作为开源资源发布,Zebra-Llama不仅提供了更易获取和更可靠的EDS信息,还为开发针对其他罕见病的专门AI解决方案建立了框架。这项工作代表了向普及罕见病管理领域专家级知识迈出的关键一步,有可能改变医疗保健提供者和患者应对复杂罕见病格局的方式。
引用
@article{arxiv.2411.02657,
title = {Zebra-Llama: A Context-Aware Large Language Model for Democratizing Rare Disease Knowledge},
author = {Karthik Soman and Andrew Langdon and Catalina Villouta and Chinmay Agrawal and Lashaw Salta and Braian Peetoom and Gianmarco Bellucci and Orion J Buske},
journal= {arXiv preprint arXiv:2411.02657},
year = {2024}
}
备注
26 pages, 4 figures, 1 supplementary figure