CliBench:用于临床决策的大型语言模型多维度、多粒度评估基准
计算与语言
2024-10-15 v2 人工智能
机器学习
摘要
人工智能(AI),特别是大型语言模型(LLMs),的集成尤其适用于临床诊断过程,具有显著潜力提高医疗护理的效率和可及性。尽管LLMs在医学领域显示出一定潜力,但其在临床诊断中的应用仍未得到充分探索,尤其是在需要做出高度精细化、针对个体患者的决策的真实临床实践中。当前对LLMs在该领域的评估往往范围狭窄,仅聚焦于特定疾病或专科,并采用简化的诊断任务。为弥合这一差距,我们引入CliBench——一个源自 MIMIC IV 数据集的新型基准,为LLMs在临床诊断中能力的全面且真实评估提供了可能。该基准不仅覆盖来自多样化医学病例的诊断,跨越多个专科,还包含临床意义的任务:治疗程序识别、实验室检测安排和药物处方。依托结构化输出本体法,CliBench实现了精确的多粒度评估,深入理解LLMs在多样化临床任务中所需粒度的能力。我们对领先的LLMs进行了零样本评估,以评估其在临床决策中的熟练程度。我们的初步结果阐明了当前LLMs在临床环境中的潜力与局限,为LLM驱动的医疗保健未来发展提供了宝贵的见解。
关键词
引用
@article{arxiv.2406.09923,
title = {CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making},
author = {Mingyu Derek Ma and Chenchen Ye and Yu Yan and Xiaoxuan Wang and Peipei Ping and Timothy S Chang and Wei Wang},
journal= {arXiv preprint arXiv:2406.09923},
year = {2024}
}
备注
Project page: https://clibench.github.io