大语言模型在医学问答中是否存在共同的弱点?
计算与语言
2024-10-14 v3
摘要
大语言模型(LLMs)在医学基准测试上取得了快速进展,但其不可靠性仍是安全实际应用的持续挑战。若要针对LLM这一类别而非特定模型进行设计,就需要理解跨模型出现的共同优势与弱点。为应对这一挑战,我们对一系列顶尖LLM进行基准测试并识别跨模型的一致模式。我们在从波兰医学执业考试中新收集的874道题目上测试了16个知名LLM。对每道题,我们为每个模型计算其top-1准确率及所分配概率的分布。随后将这些结果与人类的题目难度、题目长度以及其他模型的得分等因素进行比较。LLM准确率两两呈正相关(0.39至0.58)。模型表现也与人类表现相关(0.09至0.13),但与最高分与最低分人类在题目级准确率之差呈负相关(-0.09至-0.14)。最高输出概率与题目长度分别作为准确率的正数与负数预测因子(p<0.05)。得分最高的LLM为GPT-4o Turbo,达84%,Claude Opus、Gemini 1.5 Pro与Llama 3/3.1介于74%至79%。我们发现模型在正确作答的题目上彼此相似,且与人类考生也存在相似性。更大的模型通常表现更好,但训练、架构与数据的差异也极具影响。模型准确率与置信度正相关,与题目长度负相关。我们在旧模型上得到类似结果,并认为这些模式在采用类似训练方法的未来模型中很可能持续存在。
引用
@article{arxiv.2310.07225,
title = {Do Large Language Models have Shared Weaknesses in Medical Question Answering?},
author = {Andrew M. Bean and Karolina Korgul and Felix Krones and Robert McCraith and Adam Mahdi},
journal= {arXiv preprint arXiv:2310.07225},
year = {2024}
}
备注
8 pages, 10 figures. To appear in NeurIPS 2024 Advancements in Medical Foundation Models Workshop