中文

实验室检验结果对大型语言模型从临床病例摘要生成差别诊断的影响评估

计算与语言 2024-11-06 v1 人工智能

摘要

差别诊断对于医疗保健领域至关重要,因为它有助于医生系统性地区分那些共享相似症状的疾病。本研究评估了实验室检验结果对大型语言模型(LLM)生成的差别诊断(DDx)的影响。来自PubMed Central的50个病例报告的临床摘要被创建,包括患者人口学信息、症状和检验结果。测试了GPT-4、GPT-3.5、Llama-2-70b、Claude-2和Mixtral-8x7B等五个LLM,以生成带和不带实验室数据的Top 10、Top 5和Top 1 DDx。进行了全面的评估,包括GPT-4、知识图谱和临床医生。在实验室数据的情况下,GPT-4实现了55%的Top 1诊断准确率和60%的Top 10诊断准确率,宽松准确率可达80%。检验结果显著提高了准确率,GPT-4和Mixtral表现突出,尽管精确匹配率较低。包括肝功能、代谢/毒理学和血清/免疫检查在内的检验通常被LLM正确解释,用于差别诊断。

关键词

引用

@article{arxiv.2411.02523,
  title  = {Evaluating the Impact of Lab Test Results on Large Language Models Generated Differential Diagnoses from Clinical Case Vignettes},
  author = {Balu Bhasuran and Qiao Jin and Yuzhang Xie and Carl Yang and Karim Hanna and Jennifer Costa and Cindy Shavor and Zhiyong Lu and Zhe He},
  journal= {arXiv preprint arXiv:2411.02523},
  year   = {2024}
}