中文

RAU:基于参考的视觉语言模型解剖结构理解

计算机视觉与模式识别 2025-09-29 v1 人工智能

摘要

通过深度学习进行解剖结构理解对于医学图像中的自动报告生成、术中导航和器官定位至关重要;然而,其进展受到专家标注数据稀缺的限制。一种有希望的补救措施是利用带标注的参考图像来指导对未标注目标的解释。尽管最近的视觉语言模型(VLM)展现出非凡的视觉推理能力,但它们基于参考的理解和细粒度定位仍然有限。我们引入了 RAU,一个使用 VLM 进行基于参考的解剖结构理解的框架。我们首先表明,VLM 可以通过在中等规模数据集上训练,学习通过参考图像和目标图像之间的相对空间推理来识别解剖区域。我们通过视觉问答(VQA)和边界框预测验证了这一能力。接下来,我们证明了 VLM 导出的空间线索可以与 SAM2 的细粒度分割能力无缝集成,从而实现对小解剖区域(如血管段)的定位和像素级分割。在两个分布内和两个分布外数据集上,RAU 始终优于使用相同内存设置的 SAM2 微调基线,产生更准确的分割和更可靠的定位。更重要的是,其强大的泛化能力使其能够扩展到分布外数据集,这一特性对于医学图像应用至关重要。据我们所知,RAU 是首个探索 VLM 在医学图像中基于参考的解剖结构识别、定位和分割能力的研究。其令人鼓舞的性能突出了 VLM 驱动的方法在自动化临床工作流程中解剖结构理解的潜力。

关键词

引用

@article{arxiv.2509.22404,
  title  = {RAU: Reference-based Anatomical Understanding with Vision Language Models},
  author = {Yiwei Li and Yikang Liu and Jiaqi Guo and Lin Zhao and Zheyuan Zhang and Xiao Chen and Boris Mailhe and Ankush Mukherjee and Terrence Chen and Shanhui Sun},
  journal= {arXiv preprint arXiv:2509.22404},
  year   = {2025}
}