中文

FunBench: 评估 MLLMs 视觉问答中器官视觉阅读技能的基准

计算机视觉与模式识别 2025-03-04 v1

摘要

多模态大语言模型(MLLMs)在医学图像分析中展现出显著潜力。然而,它们在解释视网膜图像方面的能力尚未得到充分评估。现有基准缺乏细粒度任务划分,无法对其两个关键模块(即大语言模型 LLM 和视觉编码器 VE)提供模块化分析。本文引入 FunBench,一个新的视觉问答(VQA)基准,旨在全面评估 MLLMs 的器官视觉阅读技能。FunBench 具备四个层次的任务组织:模态感知、解剖感知、病灶分析和疾病诊断。它还提供了三种针对性评估模式:基于线性探针的 VE 评估、知识提示下的 LLM 评估以及整体评估。在对九个开源 MLLMs 以及 GPT-4o 进行实验后,我们发现 MLLMs 在器官视觉阅读技能方面存在显著不足,尤其是在后侧识别等基础任务中表现不佳。结果凸显了当前 MLLMs 的局限性,强调了针对特定领域训练以及改进 LLM 和 VE 的必要性。

关键词

引用

@article{arxiv.2503.00901,
  title  = {FunBench: Benchmarking Fundus Reading Skills of MLLMs},
  author = {Qijie Wei and Kaiheng Qian and Xirong Li},
  journal= {arXiv preprint arXiv:2503.00901},
  year   = {2025}
}

备注

7 pages