MedCalc-Bench:评估大语言模型的医学计算能力
计算与语言
2024-07-02 v4 人工智能
摘要
与其评估计算和基于逻辑的推理,不如关注当前用于评估大语言模型(LLM)在医学领域的基准主要集中在涉及领域知识和描述性推理的问题-答案任务。尽管如此,临床实践中,医生经常使用遵循定量方程和基于规则的推理范式的临床计算器,以进行证据基础的决策支持。为此,我们提出 MedCalc-Bench,这是一个首创性数据集,专注于评估大语言模型的医学计算能力。MedCalc-Bench 包含来自 55 种不同医学计算任务的 1000 多个人工审核实例的评估集。MedCalc-Bench 中的每个实例包括患者记录、请求计算特定医学值的问题、ground truth答案以及逐步解释说明如何得出该答案。尽管我们的评估结果显示 LLMs 在这方面的潜力,但它们尚不足以用于临床环境。常见问题包括提取错误实体、未使用计算任务的正确方程或规则,或在计算中执行算术运算时出错。我们希望我们的研究凸显了 LLMs 在医疗环境中定量知识和推理方面的不足,鼓励未来改进 LLMs 以适应各种临床计算任务。
引用
@article{arxiv.2406.12036,
title = {MedCalc-Bench: Evaluating Large Language Models for Medical Calculations},
author = {Nikhil Khandekar and Qiao Jin and Guangzhi Xiong and Soren Dunn and Serina S Applebaum and Zain Anwar and Maame Sarfo-Gyamfi and Conrad W Safranek and Abid A Anwar and Andrew Zhang and Aidan Gilson and Maxwell B Singer and Amisha Dave and Andrew Taylor and Aidong Zhang and Qingyu Chen and Zhiyong Lu},
journal= {arXiv preprint arXiv:2406.12036},
year = {2024}
}
备注
Github link: https://github.com/ncbi-nlp/MedCalc-Bench HuggingFace link: https://huggingface.co/datasets/nsk7153/MedCalc-Bench