中文

XAI-CLIP:基于多模态视觉语言模型的面向可解释医学图像分割的ROI引导扰动框架

计算机视觉与模式识别 2026-02-10 v1 人工智能

摘要

医学图像分割是临床工作流程中的关键组成部分,能够实现精准诊断、治疗规划和疾病监测。然而,尽管基于Transformer的模型在卷积架构方面表现优越,其可解释性受限仍是临床信任和部署的主要障碍。现有的解释性人工智能(XAI)技术,包括梯度基 saliency 方法和扰动方法,往往计算昂贵、需要大量前向传递,频繁产生噪声或无关解剖的解释。为解决这些限制,我们提出了 XAI-CLIP,一种ROI引导扰动框架,利用多模态视觉语言模型嵌入来局部化临床有意义的解剖区域并引导解释过程。通过将语言信息化区域局部化与医学图像分割相结合,并应用有针对性的区域感知扰动,该方法生成更清晰、边界感知的显著图,同时大幅降低计算开销。在FLARE22和CHAOS数据集上的实验表明,XAI-CLIP在常规扰动方法的occlusion-based解释方面实现了最高达60%的运行时间降低、44.6%的dice分数提升和96.7%的交并比增长。定性结果进一步确认,归因图更干净、解剖一致性更好, artifact更少,这表明将多模态视觉语言表示融入扰动-based XAI框架显著提升了可解释性和效率,从而实现透明且临床可部署的医学图像分割系统。

关键词

引用

@article{arxiv.2602.07017,
  title  = {XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models},
  author = {Thuraya Alzubaidi and Sana Ammar and Maryam Alsharqi and Islem Rekik and Muzammil Behzad},
  journal= {arXiv preprint arXiv:2602.07017},
  year   = {2026}
}