中文

基于通用实践基准评估大型语言模型的临床竞争力

计算与语言 2026-05-22 v3 人工智能

摘要

大型语言模型(LLM)在一般实践中展现出巨大的潜力。然而,现有基准和评估框架主要依赖考试式或简化的问答格式,缺乏与实际临床责任相吻合的竞争力结构。因此,LLM在多大程度上能够可靠地履行一般实践医生(GP)的职责仍不明确。在本文中,我们提出了一个 novel evaluation framework 来评估 LLM 作为 GP 的能力。基于该框架,我们引入了一般实践基准(GPBench),其数据经领域专家按照日常临床实践标准进行细致标注。我们对十个最先进的 LLM 进行评估并分析其竞争力。我们的发现表明,当前的 LLM 不适合在临床一般实践中独立部署,所有现实应用都需要持续的人类监督;进一步针对 GP 日常职责进行的优化仍是必需的。

关键词

引用

@article{arxiv.2503.17599,
  title  = {Evaluating Clinical Competencies of Large Language Models with a General Practice Benchmark},
  author = {Zheqing Li and Yiying Yang and Jiping Lang and Wenhao Jiang and Junrong Chen and Yuhang Zhao and Shuang Li and Dingqian Wang and Zhu Lin and Xuanna Li and Yuze Tang and Jiexian Qiu and Xiaolin Lu and Hongji Yu and Shuang Chen and Yuhua Bi and Xiaofei Zeng and Yixian Chen and Lin Yao},
  journal= {arXiv preprint arXiv:2503.17599},
  year   = {2026}
}