中文

评估与增强大语言模型在罕见疾病问答中的表现

计算工程、金融与科学 2024-08-19 v1 人工智能

摘要

尽管大语言模型 (LLMs) 在一般医学领域展现出令人印象深刻的能力,但其在罕见疾病诊断中的表现仍存疑问。为回答这一问题,我们旨在评估 LLMs 在罕见疾病中的诊断性能,并探索提升其在该领域有效性的方法。本工作中,我们引入了一个罕见疾病问答 (ReDis-QA) 数据集,用于评估 LLMs 在罕见疾病诊断中的表现。具体而言,我们收集了 1360 条高质量问答对,覆盖 205 种罕见疾病。此外,我们为每个问题标注了元数据,便于提取针对特定疾病及其属性的子集。基于 ReDis-QA 数据集,我们对多个开源 LLMs 进行了基准测试,结果表明诊断罕见疾病对这些模型而言仍是重大挑战。为促进罕见疾病诊断的检索增强生成,我们收集了首个罕见疾病语料库 (ReCOP),来源于国家罕见疾病组织 (NORD) 数据库。具体而言,我们将每种罕见疾病的报告拆分为多个片段,每个片段代表该疾病的不同属性,包括概述、症状、病因、影响、相关疾病、诊断和标准疗法。该结构确保每个片段中的信息与问题保持一致。实验结果表明,ReCOP 能有效提升 LLMs 在 ReDis-QA 数据集上的准确率,平均提升 8%。此外,它显著引导 LLMs 生成可追溯至现有文献的可信答案和解释。

关键词

引用

@article{arxiv.2408.08422,
  title  = {Assessing and Enhancing Large Language Models in Rare Disease Question-answering},
  author = {Guanchu Wang and Junhao Ran and Ruixiang Tang and Chia-Yuan Chang and Chia-Yuan Chang and Yu-Neng Chuang and Zirui Liu and Vladimir Braverman and Zhandong Liu and Xia Hu},
  journal= {arXiv preprint arXiv:2408.08422},
  year   = {2024}
}