中文

Beyond Medical Diagnostics: 医学多模态大语言模型在空间中的思维方式

计算机视觉与模式识别 2026-03-17 v1

摘要

视觉空间智能是医学图像解释的关键要素,但在针对3D成像的医学多模态大语言模型(MLLM)中仍然鲜有探索。这种差距持续存在是由于缺乏包含结构化3D空间标注的数据集,这些标注仅限于基本标签。在本研究中,我们引入了一个智能体管道,通过协调体积计算器和距离计算器等计算工具,结合多智能体协作和专家放射科医生验证,自主合成空间视觉问答(VQA)数据。我们提出SpatialMed,首个用于评估医学MLLM 3D空间智能的综合基准,涵盖近1万组问答对,覆盖多个器官和肿瘤类型。我们对14个最先进的MLLM进行评估并进行深入分析,发现当前模型在医学成像中缺乏稳健的空间推理能力。

关键词

引用

@article{arxiv.2603.13800,
  title  = {Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space},
  author = {Quoc-Huy Trinh and Xi Ding and Yang Liu and Zhenyue Qin and Xingjian Li and Gorkem Durak and Halil Ertugrul Aktas and Elif Keles and Ulas Bagci and Min Xu},
  journal= {arXiv preprint arXiv:2603.13800},
  year   = {2026}
}