中文

Gemini 进入医学院:探索多模态大语言模型在医学挑战问题与幻觉上的能力

计算与语言 2024-02-13 v1 人工智能 计算机视觉与模式识别 人机交互 机器学习

摘要

大语言模型有潜力在医疗行业发挥重要作用,但通过严格评估验证其安全性和有效性至关重要。为此,我们在医学推理、幻觉检测和医学视觉问答任务上,全面评估了开源大语言模型和谷歌的新型多模态大语言模型 Gemini。虽然 Gemini 表现出一定能力,但在诊断准确性上落后于 MedPaLM 2 和 GPT-4 等最先进模型。此外,Gemini 在医学 VQA 数据集上的准确率为 61.45%,显著低于 GPT-4V 的 88%。我们的分析揭示,Gemini 极易产生幻觉、过度自信和存在知识空白,这表明若不加批判地部署会存在风险。我们还按医学学科和测试类型进行了详细分析,为开发者和临床医生提供了可操作的反馈。为降低风险,我们应用了能提升性能的提示策略。此外,我们通过发布一个用于医学大语言模型评估的 Python 模块,并在 Hugging Face 上为医学领域大语言模型建立了一个专用排行榜,以促进未来的研发。Python 模块可在 https://github.com/promptslab/RosettaEval 获取。

关键词

引用

@article{arxiv.2402.07023,
  title  = {Gemini Goes to Med School: Exploring the Capabilities of Multimodal Large Language Models on Medical Challenge Problems & Hallucinations},
  author = {Ankit Pal and Malaikannan Sankarasubbu},
  journal= {arXiv preprint arXiv:2402.07023},
  year   = {2024}
}

备注

Preprint version, Under Review