中文

RareBench:大语言模型能否胜任罕见病专家?

计算与语言 2024-07-08 v2

摘要

通用大语言模型(LLM),如 GPT-4,在包括医疗诊断在内的各个领域展现出了巨大的潜力。罕见病影响着全球约 3 亿人,由于缺乏经验丰富的医生以及区分众多罕见病的复杂性,其临床诊断率往往不尽如人意。在此背景下,诸如“ChatGPT 在 17 位医生诊断失败后成功诊断出一名 4 岁儿童的罕见病”之类的近期新闻,凸显了 LLM 在临床诊断罕见病方面具有潜力但尚未被充分探索的作用。为了填补这一研究空白,我们引入了 RareBench,这是一个旨在系统评估 LLM 在罕见病领域 4 个关键维度上能力的开创性基准。同时,我们编制了关于罕见病患者的最大开源数据集,为该领域的未来研究确立了基准。为了促进罕见病的鉴别诊断,我们开发了一种动态少样本提示方法,利用从多个知识库综合而成的全面罕见病知识图谱,显著提升了 LLM 的诊断性能。此外,我们对 GPT-4 的诊断能力与专科医生进行了详尽的比较研究。我们的实验结果强调了将 LLM 整合到罕见病临床诊断过程中的可喜潜力。这为该领域未来的发展铺平了道路。

关键词

引用

@article{arxiv.2402.06341,
  title  = {RareBench: Can LLMs Serve as Rare Diseases Specialists?},
  author = {Xuanzhong Chen and Xiaohao Mao and Qihan Guo and Lun Wang and Shuyang Zhang and Ting Chen},
  journal= {arXiv preprint arXiv:2402.06341},
  year   = {2024}
}

备注

KDD2024