中文

您的另一侧!视觉语言模型在医学图像中难以识别相对位置

计算机视觉与模式识别 2025-08-11 v2

摘要

临床决策高度依赖于理解解剖结构和异常相对位置。因此,要实现视觉语言模型在临床实践中的应用,准确确定医学图像中相对位置的能力是基本前提。尽管此能力至关重要,但目前在医学图像上仍高度未被探索。为填补这一空白,我们评估了最先进的视觉语言模型,包括 GPT-4o、Llama3.2、Pixtral 和 JanusPro,发现所有模型在此基本任务中均表现不佳。鼓作于计算机视觉中成功的方法,我们研究视觉提示(如置于解剖结构上的字母数字或彩色标记)是否可以提高性能。虽然这些标记提供了适度的改进,但结果在医学图像上的表现仍显著低于在自然图像上的观察。我们的评估表明,在医学成像中,视觉语言模型更依赖先验解剖知识而非实际图像内容来回答相对位置问题,常常导致错误结论。为促进此领域的进一步研究,我们引入了 MIRP,即 Medical Imaging Relative Positioning(医学成像相对定位)基准数据集,旨在系统评估在医学图像中识别相对位置的能力。

关键词

引用

@article{arxiv.2508.00549,
  title  = {Your other Left! Vision-Language Models Fail to Identify Relative Positions in Medical Images},
  author = {Daniel Wolf and Heiko Hillenhagen and Billurvan Taskin and Alex Bäuerle and Meinrad Beer and Michael Götz and Timo Ropinski},
  journal= {arXiv preprint arXiv:2508.00549},
  year   = {2025}
}

备注

Accepted at the International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI) 2025