中文

大语言模型推理的进步赋能临床问题解决的灵活性

计算与语言 2026-01-21 v1

摘要

大语言模型(LLMs)在医学问答(QA)基准上取得了高准确率,但其灵活临床推理的能力一直存在争议。在此,我们探讨了推理型 LLMs 的进步是否提高了其在临床推理中的认知灵活性。我们评估了来自 OpenAI、Grok、Gemini、Claude 和 DeepSeek 系列的推理模型在医学抽象与推理语料库(mARC)上的表现,这是一个对抗性医学 QA 基准,它利用定势效应,在习得的启发式模式变得次优的情境下,诱导出僵化的过度依赖。我们发现,强推理模型比弱推理模型更常避免基于定势效应的陷阱,在 mARC 上达到了人类水平的表现。在医生最常答错的问题上,表现最好的 5 个模型以高置信度答对了 55% 到 70%,表明这些模型可能比人类更不易受定势效应的影响。我们的结果表明,强推理模型在医学推理中展现出更高的灵活性,在 mARC 上取得了与人类相当的表现。

关键词

引用

@article{arxiv.2601.11866,
  title  = {Advances in LLM Reasoning Enable Flexibility in Clinical Problem-Solving},
  author = {Kie Shidara and Preethi Prem and Jonathan Kim and Anna Podlasek and Feng Liu and Ahmed Alaa and Danilo Bernardo},
  journal= {arXiv preprint arXiv:2601.11866},
  year   = {2026}
}

备注

10 pages, 6 figures