DuSSS:用于半监督医学图像分割的双语义相似度监督视觉-语言模型
计算机视觉与模式识别
2024-12-18 v1
摘要
半监督医学图像分割(SSMIS)使用一致性学习来正则化模型训练,这减轻了逐像素手动标注的负担。然而,它经常受到低质量伪标签的错误监督的影响。视觉-语言模型(VLM)在通过引入文本提示引导的多模态监督信息来增强伪标签方面具有巨大潜力。尽管如此,它仍面临跨模态问题:获取的消息往往对应多个目标。为了解决上述问题,我们提出了一种用于 SSMIS 的双语义相似度监督 VLM(DuSSS)。具体而言,1)设计了双对比学习(DCL),通过捕获每种模态内的内在表示和跨模态的语义相关性来提高跨模态语义一致性。2)为了鼓励学习多种语义对应关系,提出了一种语义相似度监督策略(SSS),并将其注入 DCL 中的每个对比学习过程,通过基于分布的不确定性水平来监督语义相似度。此外,设计了一种新颖的基于 VLM 的 SSMIS 网络以弥补伪标签的质量缺陷。它利用预训练的 VLM 生成文本提示引导的监督信息,细化伪标签以获得更好的一致性正则化。实验结果表明,我们的 DuSSS 在三个公开数据集(QaTa-COV19、BM-Seg 和 MoNuSeg)上取得了出色的性能,Dice 分别为 82.52%、74.61% 和 78.03%。
引用
@article{arxiv.2412.12492,
title = {DuSSS: Dual Semantic Similarity-Supervised Vision-Language Model for Semi-Supervised Medical Image Segmentation},
author = {Qingtao Pan and Wenhao Qiao and Jingjiao Lou and Bing Ji and Shuo Li},
journal= {arXiv preprint arXiv:2412.12492},
year = {2024}
}