中文

多模态基础模型利用文本进行医学图像预测

计算机视觉与模式识别 2024-11-26 v2 人工智能 计算与语言

摘要

多模态基础模型在医学图像解读中表现出引人注目但相互矛盾的性能。然而,这些模型整合和优先处理不同数据模态(包括图像和文本)的机制仍知之甚少。在此,使用 1014 个多模态医学病例的多样化集合,我们评估了专有(GPT-4、Gemini Pro 1.0)和开源(Llama-3.2-90B、LLaVA-Med-v1.5)多模态基础模型在有和无文本描述情况下的单模态与多模态图像解读能力。在所有模型中,图像预测主要由利用文本驱动,准确率随信息性文本量的增加而单调上升。相比之下,人类在医学图像解读上的表现并未因信息性文本而提升。对文本的利用是一把双刃剑;我们表明,即便文本中轻微暗示错误诊断,也会削弱基于图像的分类,在模型此前仅依靠图像即可作答的病例中大幅降低性能。最后,我们对模型在长格式医学病例上的表现进行了医师评估,发现当文本已高度信息时,提供图像要么降低模型性能要么无影响。我们的结果表明,多模态 AI 模型可能在医学诊断推理中有用,但其准确性在很大程度上由其对文本的利用所驱动,无论好坏皆然。

关键词

引用

@article{arxiv.2311.05591,
  title  = {Multimodal Foundation Models Exploit Text to Make Medical Image Predictions},
  author = {Thomas Buckley and James A. Diao and Pranav Rajpurkar and Adam Rodman and Arjun K. Manrai},
  journal= {arXiv preprint arXiv:2311.05591},
  year   = {2024}
}