中文

OmniMedVQA:一个面向医学大视觉语言模型的新型大规模综合评估基准

图像与视频处理 2024-04-23 v2 计算机视觉与模式识别

摘要

大视觉语言模型(LVLM)在各种多模态任务中展现出卓越的能力。然而,它们在医学领域的潜力在很大程度上仍未得到探索。一个重大挑战源于缺乏涵盖各种模态和解剖区域的多样化医学图像,而这在真实世界的医学应用中至关重要。为了解决这个问题,本文引入了OmniMedVQA,一个新颖的综合医学视觉问答(VQA)基准。该基准收集自73个不同的医学数据集,包括12种不同的模态,覆盖超过20个不同的解剖区域。重要的是,该基准中的所有图像均源自真实的医学场景,确保符合医学领域的要求,并适用于评估LVLM。通过广泛的实验,我们发现现有的LVLM难以有效解决这些医学VQA问题。更令人惊讶的是,医学专用LVLM的表现甚至不如通用领域模型,这呼唤在生物医学领域出现更通用、更鲁棒的LVLM。评估结果不仅揭示了当前LVLM在理解真实医学图像方面的局限性,也凸显了我们数据集的重要性。我们的代码和数据集可在https://github.com/OpenGVLab/Multi-Modality-Arena获取。

关键词

引用

@article{arxiv.2402.09181,
  title  = {OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM},
  author = {Yutao Hu and Tianbin Li and Quanfeng Lu and Wenqi Shao and Junjun He and Yu Qiao and Ping Luo},
  journal= {arXiv preprint arXiv:2402.09181},
  year   = {2024}
}