中文

CliMedBench:用于临床场景中评估中文医学大语言模型的大型基准测试

计算与语言 2024-10-07 v1

摘要

随着大规模语言模型 (LLM) 在各个领域的普及,临床医学场景对统一的评估标准迫切需求日益增长。在此背景下,我们提出CliMedBench——一个包含14个由专家指导的核心临床场景的综合性基准测试,旨在评估LLM在7个维度上的医学能力。该基准包含33,735个问题,来源于顶尖三甲医院的真实医学报告及真实考试题目。我们通过多种方式验证了该基准的可靠性。随后使用现有LLM进行的实验得出以下结论:(i)中文医学LLM在该基准上表现不佳,尤其是在医学推理和事实一致性方面,凸显了临床知识和诊断准确性的提升需求。(ii)一些通用领域LLM在医疗诊疗中展现出巨大的潜力,而许多医学LLM的有限输入容量则限制了其实际应用。这些发现揭示了LLM在临床场景中的优势与局限,为医学研究提供了关键见解。

关键词

引用

@article{arxiv.2410.03502,
  title  = {CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios},
  author = {Zetian Ouyang and Yishuai Qiu and Linlin Wang and Gerard de Melo and Ya Zhang and Yanfeng Wang and Liang He},
  journal= {arXiv preprint arXiv:2410.03502},
  year   = {2024}
}

备注

accepted by ENMLP-2024