中文

从分数到步骤:诊断并提升大语言模型在循证医学计算中的表现

计算与语言 2026-02-03 v2 人工智能

摘要

大语言模型(LLMs)在医学基准测试中展现出令人鼓舞的性能;然而,它们执行医学计算的能力——临床决策的一个关键方面——仍未得到充分探索且评估不佳。现有基准通常仅以较宽的数值容差评估最终答案,忽略了系统性的推理失败,并可能导致严重的临床误判。在这项工作中,我们以更强的临床可信度为重点,重新审视了医学计算评估。首先,我们清理并重构了MedCalc-Bench数据集,并提出了一个新的逐步评估流程,该流程独立评估公式选择、实体提取和算术计算。在此细粒度框架下,GPT-4o的准确率从62.7%下降到43.6%,揭示了先前评估所掩盖的错误。其次,我们引入了一个自动错误分析框架,为每种失败模式生成结构化的归因。人工评估证实了其与专家判断的一致性,从而实现了可扩展且可解释的诊断。最后,我们提出了一个模块化的智能体流程MedRaC,它结合了检索增强生成和基于Python的代码执行。在没有任何微调的情况下,MedRaC将不同大语言模型的准确率从16.35%提高到53.19%。我们的工作凸显了当前基准测试实践的局限性,并提出了一种在临床上更忠实的方法论。通过实现透明且可迁移的推理评估,我们向使基于大语言模型的系统在真实世界医疗应用中变得可信赖更近了一步。

关键词

引用

@article{arxiv.2509.16584,
  title  = {From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations},
  author = {Benlu Wang and Iris Xia and Yifan Zhang and Junda Wang and Feiyun Ouyang and Shuo Han and Arman Cohan and Hong Yu and Zonghai Yao},
  journal= {arXiv preprint arXiv:2509.16584},
  year   = {2026}
}

备注

Equal contribution for the first two authors. To appear as an Oral presentation in the proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2025