当 CNN 遇上 ViT:面向多类医学图像语义分割的半监督学习
图像与视频处理
2024-02-12 v2 计算机视觉与模式识别
摘要
由于医学影像界缺乏高质量标注,半监督学习方法在图像语义分割任务中备受重视。本文提出了一种先进的基于一致性感知伪标签的自集成方法,以在半监督学习中充分利用视觉Transformer(ViT)与卷积神经网络(CNN)的能力。我们提出的框架包含一个由 ViT 与 CNN 相互增强的特征学习模块,以及一个面向一致性感知目的的鲁棒引导模块。在特征学习模块中,伪标签由 CNN 与 ViT 的视角循环且分别地推断和利用以扩充数据集,并互为裨益。同时,为特征学习模块设计了扰动方案,并利用网络权重平均来构建引导模块。由此,该框架结合了 CNN 与 ViT 的特征学习优势,通过双视角协同训练提升性能,并以半监督方式实现一致性感知监督。我们对 CNN 与 ViT 的所有可选监督模式进行了详尽的拓扑探索与验证,展示了我们的方法在半监督医学图像分割任务上最具前景的性能与具体设置。实验结果表明,所提方法在公开基准数据集上以多种指标取得了最先进的性能。代码已公开可用。
引用
@article{arxiv.2208.06449,
title = {When CNN Meet with ViT: Towards Semi-Supervised Learning for Multi-Class Medical Image Semantic Segmentation},
author = {Ziyang Wang and Tianze Li and Jian-Qing Zheng and Baoru Huang},
journal= {arXiv preprint arXiv:2208.06449},
year = {2024}
}