NeuroQA:面向3D脑磁共振影像理解的大规模图像 grounding 测试基准
计算机视觉与模式识别
2026-05-21 v1 人工智能
计算与语言
机器学习
图像与视频处理
摘要
我们提出 NeuroQA,这是一个用于3D脑磁共挏成像(MRI)视觉问答的大规模基准测试,包含来自12,977名受试者、56,953个问答对,覆盖12个数据集,年龄跨5-104岁,涵盖阿尔茨海默病、帕金森病、肿瘤、白质疾病和神经发育等五个临床领域。与先前在2D切片上操作或依赖狭窄诊断标签的医学视觉问答(VQA)方法不同,NeuroQA 将每个问题与完整的3D体数据相关联。它评估了11项临床相关推理技能,涵盖Yes/No、多选和开放式问题格式。其中203个模板中,131个为图像 grounding 类型(可通过3平面查看器回答),72个为图像导向类型(基于量化体积测量或临床仪器数据)。为消除文本快捷方式,我们应用了答案分布细化技术,将封闭格式的文本-only准确率从>80%降至44.6%;通过随基准发布的图像grounding协议单独评估了图像必要性。我们采用38规则的确定性管道和两轮专家审核,对每个问答对都与FreeSurfer测量值、元数据或放射学报告字段进行核查,确保模板间无同主题矛盾。我们进行了临床医生评估,两位医生独立评估100个冻结测试项。对于封闭格式(Yes/No + 多选)测试集中的项目,最佳的零样本视觉语言模型和受监督的3D CNN基线分别达到47.5%和43.7%的准确率,均低于49.4%的文本-only多数模板底线。NeuroQA采用两级发布模式,为开放数据集提供公开问答对,为数据使用协议(DUA)限制的数据集提供可复现的生成脚本,同时包含主题级划分、保留的私有测试集以及在线排行榜。
关键词
引用
@article{arxiv.2605.20525,
title = {NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding},
author = {Mohammad H. Abbasi and Favour Nerrise and Shaurnav Ghosh and Ridvan Yesiloglu and Yuncong Mao and Bailey Trang and Mohammad Asadi and Merryn Daniel and Gustavo Chau Loo Kung and Ken Chang and Pavan Pinkesh Shah and Adam Turnbull and Kyan Younes and Seena Dehkharghani and Ehsan Adeli},
journal= {arXiv preprint arXiv:2605.20525},
year = {2026}
}
备注
30 pages, dataset and benchmark release