中文

视觉语言模型与大语言模型在胃肠病学中的表现:GPT、Claude、Llama、Phi、Mistral、Gemma及量化模型

计算与语言 2026-04-10 v2 人工智能

摘要

背景与目的:本研究评估了大语言模型(LLM)和视觉语言模型(VLM)在胃肠病学中的医学推理性能。方法:我们使用300道胃肠病学执业医师考试风格的多选题,其中138题包含图片,系统性地评估了模型配置、参数以及运用GPT-3.5时的提示工程策略。随后,我们评估了包括GPT(3.5、4、4o、4omini)、Claude(3、3.5)、Gemini(1.0)、Mistral、Llama(2、3、3.1)、Mixtral和Phi(3)等专有和开源LLM(版本)在不同接口(网页和API)、计算环境(云端和本地)以及模型精度(有无量化)下的表现。最后,我们采用半自动化管道评估准确率。结果:在专有模型中,GPT-4o(73.7%)和Claude3.5-Sonnet(74.0%)取得了最高的准确率,超过了顶尖的开源模型:Llama3.1-405b(64%)、Llama3.1-70b(58.3%)和Mixtral-8x7b(54.3%)。在量化开源模型中,6位量化后的Phi3-14b(48.7%)表现最佳。量化模型的得分与全精度模型Llama2-7b、Llama2-13b和Gemma2-9b相当。值得注意的是,VLM在包含图片的问题上的表现在提供图片后并未提升,反而在提供LLM生成的描述时表现下降。相比之下,当图片伴随人工编写的图片描述时,准确率提升了10%。结论:综上所述,尽管LLM在医学推理中展现出稳健的零样本性能,但VLM在集成视觉数据方面仍面临挑战。有效的部署涉及精确确定最佳模型配置,鼓励用户考虑要么选择专有模型的高性能,要么选择开源模型的灵活可调性。

关键词

引用

@article{arxiv.2409.00084,
  title  = {Vision-Language and Large Language Model Performance in Gastroenterology: GPT, Claude, Llama, Phi, Mistral, Gemma, and Quantized Models},
  author = {Seyed Amir Ahmad Safavi-Naini and Shuhaib Ali and Omer Shahab and Zahra Shahhoseini and Thomas Savage and Sara Rafiee and Jamil S Samaan and Reem Al Shabeeb and Farah Ladak and Jamie O Yang and Juan Echavarria and Sumbal Babar and Aasma Shaukat and Samuel Margolis and Nicholas P Tatonetti and Girish Nadkarni and Bara El Kurdi and Ali Soroush},
  journal= {arXiv preprint arXiv:2409.00084},
  year   = {2026}
}

备注

Manuscript Pages: 34, Figures: 7, Tables: 2, Supplementary File Pages: 35, Data Transparency Statement: Code is available at: https://github.com/Sdamirsa/LLM-VLM-in-Gastroenterology . Study data from American College of Gastroenterology (ACG) are restricted and available upon request with ACG permission. Correction: updated abstract considering Llama3.1 results