面向通用医学图像分割的多模态因果驱动表征学习
计算机视觉与模式识别
2026-05-15 v2
摘要
视觉语言模型(VLM),如CLIP,已在计算机视觉任务中展现出惊人的零样学习能力。然而,其在医学成像领域的应用仍面临挑战,主要due to 医学数据的高变异性和复杂性。具体而言,医学图像常因包括设备差异、操作器官 artifacts 和成像模式等在内的各种 confounder 引起显著的领域偏移,这会导致模型在不可见领域中表现不佳。为此,我们提出一种名为Multimodal Causal-Driven Representation Learning(MCDRL)的新框架,将因果推断与VLM相结合,解决医学图像分割中的领域泛化问题。MCDRL分为两个步骤:首先,它利用CLIP的跨模态能力识别候选病灶区域,通过专为表示领域特定变异而设计的文本提示构建 confounder dictionary;其次,它训练一种因果干预网络,该网络利用该dictionary识别并消除这些领域特定变异的影响,同时保留对分割任务至关重要的解剖结构信息。大量实验表明,MCDRL consistently 超过了竞争方法,实现更高的分割精度,显示出强大的鲁棒性。
引用
@article{arxiv.2508.05008,
title = {Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation},
author = {Xusheng Liang and Lihua Zhou and Nianxin Li and Miao Xu and Ziyang Song and Dong Yi and Jinlin Wu and Jiawei Ma and Hongbin Liu and Zhen Lei and Jiebo Luo},
journal= {arXiv preprint arXiv:2508.05008},
year = {2026}
}
备注
Accepted by CVPR 2026