中文

MedCalc-Eval 与 MedCalc-Env:推动大语言模型医学计算能力发展

计算与语言 2025-11-03 v1 人工智能

摘要

随着大语言模型 (LLM) 进入医学领域,大多数基准测试在问答或描述性推理方面进行评估,忽略了临床决策中至关重要的定量推理。现有数据集如MedCalc-Bench 覆盖的计算任务有限,无法反映真实世界的计算场景。我们引入MedCalc-Eval,目前最大规模的医学计算能力评估基准,包含700多个任务,分为方程式类(如Cockcroft-Gault、BMI、BSA)和规则评分系统类(如Apgar、Glasgow意识尺度)两类。这些任务涵盖内科、外科、儿科、心血管等多个专科,提供更广泛且更具挑战性的评估环境。为提升性能,我们进一步开发MedCalc-Env,基于InternBootcamp框架构建的强化学习环境,实现多步临床推理与规划。对Qwen2.5-32B模型进行微调后,在MedCalc-Eval上取得最先进成绩,在数值灵敏度、公式选择和推理鲁棒性方面均取得显著提升。剩余挑战包括单位换算、多条件逻辑和情境理解。代码和数据集已公开。

关键词

引用

@article{arxiv.2510.27267,
  title  = {MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models},
  author = {Kangkun Mao and Jinru Ding and Jiayuan Chen and Mouxiao Bian and Ruiyao Chen and Xinwei Peng and Sijie Ren and Linyang Li and Jie Xu},
  journal= {arXiv preprint arXiv:2510.27267},
  year   = {2025}
}