中文

模式识别还是医学知识?医学多项选择题的问题

计算与语言 2025-08-22 v2 人工智能 机器学习

摘要

大型语言模型(LLMs)如ChatGPT在医学领域显示出巨大潜力,通常使用基于USMLE等考试的多项选择题(MCQs)进行评估。然而,此类基准可能通过奖励模式识别和应试启发法而高估真实的临床理解。为了研究这一点,我们创建了一个以虚构器官“Glianorex”为中心的虚构医学基准,从而将记忆知识与推理能力分开。我们使用领先的LLMs生成英语和法语的教科书和MCQs,然后在零样本设置中评估了专有、开源和领域特定模型。尽管内容是虚构的,模型平均得分达到64%,而医生仅得27%。微调的医学模型在英语中优于基础模型,但在法语中并非如此。消融和可解释性分析表明,模型经常依赖浅层线索、应试策略和幻觉推理来识别正确答案。这些结果表明,基于MCQ的标准评估可能无法有效衡量临床推理,并强调需要更稳健、临床有意义的LLM评估方法。

关键词

引用

@article{arxiv.2406.02394,
  title  = {Pattern Recognition or Medical Knowledge? The Problem with Multiple-Choice Questions in Medicine},
  author = {Maxime Griot and Jean Vanderdonckt and Demet Yuksel and Coralie Hemptinne},
  journal= {arXiv preprint arXiv:2406.02394},
  year   = {2025}
}

备注

ACL 2025 main