中文

Anatomy-VLM:用于医学解释的细粒度视觉语言模型

计算机视觉与模式识别 2025-11-12 v1 人工智能 机器学习

摘要

从放射学获取准确的疾病解释仍然具有挑战性 due to 影像异质性。实现专家水平的诊断决策需要将细微的图像特征与临床知识相结合。然而,主要的视觉语言模型(VLMs)将图像视为整体实体,忽略了疾病诊断所必需的细粒度图像细节。临床医生会利用其既定的医学知识,识别解剖结构作为重要感兴趣区域(ROI)。以此为灵感,我们引入了 Anatomy-VLM,这是一个细粒度的视觉语言模型,包含多尺度信息。首先,我们设计了一个模型编码器来从整个医学图像中局部化关键解剔构特征。其次,这些区域由结构化知识丰富,以实现上下文感知的解释。最后,模型编码器将多尺度医学信息对齐,以生成临床可解释的疾病预测。Anatomy-VLM 在 both in-和 out-of-distribution 数据集上实现了卓越的性能。我们还验证了 Anatomy-VLM 在下游图像分割任务中的性能,这表明其细粒度对齐捕获了解剔构和病理相关知识。此外,Anatomy-VLM 的编码器支持零样本解剔构级解释,提供了强大的专家级临床解释能力。

关键词

引用

@article{arxiv.2511.08402,
  title  = {Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation},
  author = {Difei Gu and Yunhe Gao and Mu Zhou and Dimitris Metaxas},
  journal= {arXiv preprint arXiv:2511.08402},
  year   = {2025}
}

备注

Accepted to Winter Conference on Applications of Computer Vision (WACV) 2026