中文

它是太多选项了:生成式AI和医学教育中多选题的陷阱

计算与语言 2025-03-19 v1 人工智能

摘要

大型语言模型(LLM)在多选题(MCQ)基准测试上的表现经常被引用为其医学能力的证据。我们假设LLM在医学MCQ上的表现可能部分是虚幻的,受医学内容知识和推理能力之外的因素驱动。为评估这一假设,我们构建了一个包含自由响应问题及其对应MCQ的新基准(FreeMedQA)。使用该基准,我们评估了三种最先进的LLM(GPT-4o、GPT-3.5和LLama-3-70B-instruct),发现其在自由响应问题上的表现相较于多选题下降了平均39.43%(p = 1.3 * 10^-5),这一下降幅度大于人类下降22.29%。为隔离MCQ格式对表现的作用,我们进行了遮蔽实验,逐步遮蔽问题干的不同部分。在100%遮蔽时,LLM的多选题平均表现比随机选择高出6.70%(p = 0.002),其中一款LLM(GPT-4o)达到37.34%的准确率。值得注意的是,对于所有LLM,自由响应问题的表现几乎为零。我们的结果凸显了医学MCQ基准测试在高估LLM医学能力方面的不足,更广泛地指出了利用LLM评估的自由响应问题改进人类和机器评估的潜力。

关键词

引用

@article{arxiv.2503.13507,
  title  = {NeurIPS 2023 LLM Efficiency Fine-tuning Competition},
  author = {Mark Saroufim and Yotam Perlitz and Leshem Choshen and Luca Antiga and Greg Bowyer and Christian Puhrsch and Driss Guessous and Supriya Rao and Geeta Chauhan and Ashvini Kumar and Jindal Pawan Kumar and Rajpoot Ankur Parikh and Joe Isaacson and Weiwei Yang},
  journal= {arXiv preprint arXiv:2503.13507},
  year   = {2025}
}

备注

11 pages, 10 figures