在大语言模型回答和解释挑战性医学问题上的基准测试
计算与语言
2026-02-19 v6
摘要
大语言模型在回答医学问题方面表现出令人印象深刻的性能,例如在医学执照考试中取得及格分数。然而,医学委员会考试或一般临床问题无法捕捉真实临床病例的复杂性。此外,缺乏参考解释意味着我们难以评估模型决策的推理过程,而这是支持医生做出复杂医疗决策的关键组成部分。为应对这些挑战,我们构建了两个新数据集:JAMA Clinical Challenge 和 Medbullets。数据集和代码可在 https://github.com/HanjieChen/ChallengeClinicalQA 获取。JAMA Clinical Challenge 包含基于挑战性临床病例的问题,而 Medbullets 则由模拟临床问题组成。这两个数据集均构建为多项选择题问答任务,并附有专家撰写的解释。我们使用各种提示词在两个数据集上评估了七个大语言模型。实验表明,我们的数据集比以往的基准测试更具难度。对模型生成解释的深入自动评估和人工评估,揭示了大语言模型在可解释医学问答方面的潜力与不足。
引用
@article{arxiv.2402.18060,
title = {Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions},
author = {Hanjie Chen and Zhouxiang Fang and Yash Singla and Mark Dredze},
journal= {arXiv preprint arXiv:2402.18060},
year = {2026}
}
备注
NAACL 2025