迷失在体积中:用于评估3D医学视觉语言模型语义-空间理解的CT-SpatialVQA基准
计算机视觉与模式识别
2026-05-12 v1
摘要
3D医学视觉语言模型的最新进展使得能够对体积图像和文本进行联合推理,在医学视觉问答(VQA)和报告生成方面表现出色。尽管取得了这些进展,但目前尚不清楚这些模型是从3D体积中学习空间定位的解剖结构,还是主要依赖于学习到的先验知识和语言相关性。这种不确定性源于缺乏对体积医学VLM中语义-空间推理的系统性评估,以支持临床可靠的决策。为填补这一空白,我们引入了CT-SpatialVQA,这是一个旨在评估3D CT数据中语义-空间推理的基准。该基准包含9077个临床基础的问答(QA)对,这些问答对直接源自1601份放射学报告和CT体积,并通过一个稳健的LLM辅助流程进行验证,人工共识一致率达95%。我们的数据集要求明确的解剖定位、侧别意识、结构比较以及3D结构间关系推理。我们还引入了一个标准化的评估协议,并对八个3D医学VLM进行了基准测试,发现它们在语义-空间推理任务上性能严重下降,平均准确率为34%,且通常低于随机水平,这凸显了为获得值得信赖的临床应用而需要更深入整合体积证据的必要性。
引用
@article{arxiv.2605.08787,
title = {Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models},
author = {Mashrafi Monon and Umaima Rahman and Asif Hanif and Numan Saeed and Mohammad Yaqub},
journal= {arXiv preprint arXiv:2605.08787},
year = {2026}
}