中文

SpineBench:用于脊椎病理分析的多模态大语言模型基准测试

计算机视觉与模式识别 2025-10-15 v1

摘要

随着多模态大语言模型(MLLMs)在医疗领域的日益集成,对其在 various medical 领域性能的全面评估变得至关重要。然而,现有基准主要评估通用医学任务,未能充分捕捉在脊椎等细化领域的性能,这些领域高度依赖视觉输入。为此,我们引入 SpineBench,这是一个针对脊椎领域的细粒度分析和评估 MLLM 的综合性视觉问答(VQA)基准测试。SpineBench 包含 64,878 对 QA 问答对,来自 40,263 张脊椎图像,覆盖 11 种脊椎疾病,涵盖两个关键临床任务:脊椎疾病诊断和脊椎病灶定位,均采用多选格式。SpineBench 通过整合和标准化来自开源脊椎疾病数据集的图像-标签对,并基于视觉相似性(相似但非完全相同的疾病)为每个 VQA 问答对生成具有挑战性的难负选项,模拟真实世界的复杂场景。我们在 SpineBench 上评估了 12 个领先的 MLLM。结果显示,这些模型在脊椎任务上的表现不佳,凸显了当前 MLLM 在脊椎领域的局限性,并为脊椎医疗应用的未来改进指明了方向。SpineBench 已公开提供,网址为 https://zhangchenghanyu.github.io/SpineBench.github.io/。

关键词

引用

@article{arxiv.2510.12267,
  title  = {SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis},
  author = {Chenghanyu Zhang and Zekun Li and Peipei Li and Xing Cui and Shuhan Xia and Weixiang Yan and Yiqiao Zhang and Qianyu Zhuang},
  journal= {arXiv preprint arXiv:2510.12267},
  year   = {2025}
}

备注

Proceedings of the 33rd ACM International Conference on Multimedia,ACMMM 2025 Dataset Track