MedCalc-Bench 并未测度你想象的东西:基准审计与开放书籍评估的论证
机器学习
2026-03-04 v1 人工智能
摘要
MedCalc-Bench是广泛使用的用于评估LLM在临床计算器任务方面性能的基准测试,目前直接提示的SOTA得分在Verified split(HELM MedHELM排行榜)停滞于约35%,最佳已发布方法(approach-RL with verifiable rewards)达到74%。本文贡献三方面挑战当前基准框架:第一,系统审计了基准测试的计算器实现,识别并修复了20多处错误,涵盖关键公式不准确、运行时错误等,来自NeurIPS发表数据集;第二,我们表明简单干预——在推理时提供模型计算器规范(“开放书籍”提示)——可将GLM-4.6V和GLM-4.7的准确率从约52%提升至81-85%,超越所有已发布结果,包括RL训练系统,无需任何微调;第三,我们建立了95-97%的上限,使用GPT-5.2-Thinking,剩余错误主要归因于ground-truth问题和数据集歧义。我们的发现表明,MedCalc-Bench主要测度公式记忆和算术精度,而非临床推理,应更恰当地界定为工具使用评估。
关键词
引用
@article{arxiv.2603.02222,
title = {MedCalc-Bench Doesn't Measure What You Think: A Benchmark Audit and the Case for Open-Book Evaluation},
author = {Artus Krohn-Grimberghe},
journal= {arXiv preprint arXiv:2603.02222},
year = {2026}
}