医学领域的大语言模型与视觉语言模型适应性:我们在取得进展吗?
摘要
近期 Several 项研究旨在开发专为医学应用而设计的基础模型,通过在公开的生物医学语料库上进行持续预训练来适应通用型大语言模型(LLM)和视觉语言模型(VLM)。这些工作通常声称,领域适应性预训练(DAPT)能提高在下游医学任务(如回答医学执照考试问题)上的性能。本文比较了七个公开的“医学”LLM 和两个 VLM 与其对应的基础模型,得出结论:所有医学 VLM 和近乎所有医学 LLM 在医学问答(QA)任务的零/少样本提示下,均未能 consistently 超过其基础模型。例如,在我们考虑的 3-shot 设置下,医学 LLM 仅在 12.1% 的情况下超过其基础模型,在 49.8% 的情况下达到(统计)持平,在剩余的 38.2% 的情况下显著低于其基础模型。我们的结论基于 (i) 对每个医学模型与其对应的基础模型进行直接 head-to-head 比较;(ii) 为每个模型单独优化提示;(iii) 考虑比较中的统计不确定性。尽管这些基本做法在文献中并不一致地采用,但我们的消除实验表明,它们显著影响结论。我们的发现表明,领先的通用领域模型可能已经具备强大的医学知识和推理能力,并为未来研究提供了建议,以强化其结论。
引用
@article{arxiv.2411.04118,
title = {Medical Adaptation of Large Language and Vision-Language Models: Are We Making Progress?},
author = {Daniel P. Jeong and Saurabh Garg and Zachary C. Lipton and Michael Oberst},
journal= {arXiv preprint arXiv:2411.04118},
year = {2024}
}
备注
This version was published at EMNLP 2024 Main Conference as a Long Paper (Oral). See the extended version (arXiv:2411.08870) for additional results on QA tasks based on clinical notes and evaluations in the supervised fine-tuning regime