面向放射学的视觉语言模型视觉提示工程
计算机视觉与模式识别
2025-06-24 v3
摘要
医学图像分类在临床决策中发挥着关键作用,但大多数模型受限于固定的预定义类别,限制了其对新情况的适应性。对比语言-图像预训练 (CLIP) 提供了通过多模态大规模预训练实现零样例分类的有前景的解决方案。然而,虽然 CLIP 有效地捕获了全局图像内容,但放射学需要更局部地关注特定病灶区域,以提升解释性和诊断准确性。为此,我们探索了将视觉线索嵌入零样例分类中的潜力,将视觉标记(如箭头、边界框和圆形)直接嵌入放射学图像,以引导模型注意力。在四个公开胸部 X 光数据集上进行评估,我们证明视觉标记可使 AUROC 提升最高 0.185,凸显了其在提升分类性能方面的有效性。此外,注意力图分析确认,视觉线索有助于模型聚焦于临床相关区域,从而实现更具解释性的预测。为支持进一步的研究,我们使用公开数据集并提供代码库和预处理管道于 https://github.com/MIC-DKFZ/VPE-in-Radiology,为医学影像中局部化分类的未来工作树立了参考基准。
引用
@article{arxiv.2408.15802,
title = {Visual Prompt Engineering for Vision Language Models in Radiology},
author = {Stefan Denner and Markus Bujotzek and Dimitrios Bounias and David Zimmerer and Raphael Stock and Klaus Maier-Hein},
journal= {arXiv preprint arXiv:2408.15802},
year = {2025}
}
备注
Accepted at ECCV 2024 Workshop on Emergent Visual Abilities and Limits of Foundation Models & Medical Imaging with Deep Learning 2025