UCSF-PDGM-VQA:用于脑肿瘤MRI解读的视觉问答数据集
计算机视觉与模式识别
2026-05-21 v2 人工智能
计算与语言
摘要
脑肿瘤诊断在很大程度上依赖于磁共振成像(MRI)评估,这要求放射科医生综合多个3D序列和纵向研究中的数千张图像。这一过程需要高级神经放射学培训,带来巨大的认知负荷,且非常耗时。尽管放射学需求日益增长,但这种专业知识难以规模化,给当前的医疗系统带来压力。视觉语言模型(VLM)为通过半自动、交互式解读复杂脑部MRI来减轻这一负担提供了机会。然而,由于缺乏专门的评估基准,它们目前在神经肿瘤学中尚未得到充分利用。我们引入了一个临床相关的视觉问答(VQA)基准——UCSF-PDGM-VQA数据集——包含来自公共UCSF-PDGM数据集中473项胶质瘤相关MRI研究的2,387个问答对。我们进一步在此数据集上为六个最先进的视觉语言模型(VLM)和一个大语言模型建立了性能基线。我们发现,当前模型无法有效处理多序列、三维的MRI扫描,从而导致视觉特征被抑制并过度依赖语言先验,引发模态崩溃。这些发现突显了当前模型在临床环境中可靠性和安全性的严重缺陷,迫切需要开发稳健的、特定领域的VLM。
引用
@article{arxiv.2605.17140,
title = {UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation},
author = {Shiv Ghosh and Junayd Lateef and Chih-Hua Liu and Yannan Yu and Andreas M. Rauschecker and Madhumita Sushil},
journal= {arXiv preprint arXiv:2605.17140},
year = {2026}
}
备注
10 pages, 2 figures, 6 tables