中文

CausalCLIPSeg:通过因果干预释放 CLIP 在指涉医学图像分割中的潜能

计算机视觉与模式识别 2025-03-21 v1

摘要

指涉医学图像分割旨在描绘由文本描述指示的病灶。由于其不同的数据属性,视觉线索和文本线索的对齐是一个具有挑战性的任务。受大规模预训练视觉语言模型的启发,我们提出了 CausalCLIPSeg,一个以 CLIP 为基础的指涉医学图像分割框架。尽管 CLIP 未在医疗数据上进行训练,我们通过量身定制的跨模态解码方法将其丰富的语义空间导入医疗领域,以实现文本到像素的对齐。此外,为缓解可能导致模型学习虚假关联而非有意义因果关系的潜在偏见,CausalCLIPSeg 引入了一个因果干预模块,该模块自行标注混淆因素并从输入中挖掘用于分割判断的因果特征。我们还设计了一个对抗性 min-max 游戏,以优化因果特征并惩罚混淆因素。大量实验表明,我们提出的方法在性能上实现了最先进的水平。代码已公开于 https://github.com/WUTCM-Lab/CausalCLIPSeg。

关键词

引用

@article{arxiv.2503.15949,
  title  = {CausalCLIPSeg: Unlocking CLIP's Potential in Referring Medical Image Segmentation with Causal Intervention},
  author = {Yaxiong Chen and Minghong Wei and Zixuan Zheng and Jingliang Hu and Yilei Shi and Shengwu Xiong and Xiao Xiang Zhu and Lichao Mou},
  journal= {arXiv preprint arXiv:2503.15949},
  year   = {2025}
}

备注

MICCAI 2024