中文

OmniBrainBench:面向多阶段临床任务的综合性脑成像多模态基准

计算机视觉与模式识别 2025-12-29 v2 人工智能

摘要

脑成像分析是脑障碍诊断和治疗的关键任务,多模态大语言模型(MLLM)正逐渐在其中发挥作用。然而,现有的脑成像视觉问答(VQA)基准要么覆盖的成像模态有限,要么仅限于粗糙的病理描述,限制了其在临床整个流程中对 MLLM 综合能力的评估。为此,我们引入 OmniBrainBench——第一个专为评估 MLLM 在脑成像分析中多模态理解能力而设计的综合性 VQA 基准,支持封闭式和开放式评估。OmniBrainBench 包含 15 种不同的脑成像模态,来自 30 个经验证实的医学来源,产生 9,527 对经验证的 VQA 对和 31,706 张图像。它模拟了临床工作流程,涵盖 15 个多阶段临床任务,由专业放射科医生严格验证。评估 24 项最新模型(包括开源通用型、医学专用和专有 MLLM),凸显了 OmniBrainBench 提出的重大挑战。实验结果显示,专有 MLLM 如 GPT-5(63.37%)虽领先于其他模型,但仍远低于医生(91.35%),而医学专用模型在封闭式和开放式 VQA 中表现呈现较大差异。开源通用型 MLLM 总体上落后于对手,但在特定任务中表现突出,所有模型在复杂术前推理方面均表不足,揭示了视觉与临床之间的关键鸿沟。OmniBrainBench 建立了脑成像分析中评估 MLLM 的新标准,凸显了其与医生之间的差距。我们公开发布了该基准数据集。

关键词

引用

@article{arxiv.2511.00846,
  title  = {OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks},
  author = {Zhihao Peng and Cheng Wang and Shengyuan Liu and Zhiying Liang and Zanting Ye and Minjie Ju and PeterYM Woo and Yixuan Yuan},
  journal= {arXiv preprint arXiv:2511.00846},
  year   = {2025}
}