中文

生成式模型提升医学视觉语言模型中的短语定位能力

计算机视觉与模式识别 2025-07-17 v1

摘要

短语定位,即将自然语言短语映射到特定图像区域,具有通过临床报告实现疾病局部化的巨大潜力。虽然当前最先进的方法依赖判别式、无监督对比模型,但我们证明了生成式文本到图像扩散模型,利用跨注意力图谱,可实现优于当前判别方法的零样本短语定位性能。与先前假设相反,我们展示了使用冻结的领域特定语言模型(如CXR-BERT)进行微调的生成式模型,显著优于领域无关的方法。该 setup 实现了显著的改进,mIoU 分数翻了一番。这些发现凸显了生成模型在短语定位任务中潜在的未被充分探索的价值。为进一步提升性能,我们引入了双模态偏置合并(Bimodal Bias Merging, BBM),一种新颖的后处理技术,用于对齐文本和图像偏置以识别高确定性区域。BBM 细化了跨注意力图,从而实现更高的局部化准确性。我们的结果确立了生成方法在医学影像领域的短语定位更有效的范式,为临床实践中更稳健和可解释的应用铺平了道路。源代码和模型权重可在 https://github.com/Felix-012/generate_to_ground 获取。

关键词

引用

@article{arxiv.2507.12236,
  title  = {Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models},
  author = {Felix Nützel and Mischa Dombrowski and Bernhard Kainz},
  journal= {arXiv preprint arXiv:2507.12236},
  year   = {2025}
}

备注

20 pages, 6 figures. To appear in Proc. MIDL 2025 (PMLR)