掩码图像建模助推半监督语义分割
计算机视觉与模式识别
2024-11-15 v2
摘要
鉴于半监督学习与自监督学习共享一个基本原则——有效地从无标签数据中建模知识,各类半监督语义分割方法已引入具有代表性的自监督学习范式以进一步正则化。然而,最先进的生成式自监督范式——掩码图像建模——的潜力鲜有研究。该范式通过在像素重建过程中建立掩码图像中掩码部分与可见部分之间的联系来学习知识。通过继承并拓展这一洞见,我们成功利用掩码图像建模来提升半监督语义分割。具体而言,我们提出了一种新颖的按类别掩码图像建模,根据各自的类别独立重建不同的图像区域。这样,掩码诱导的联系在每个类别内部建立,缓解了基础掩码图像建模中单纯重建图像所带来的语义混淆。为加强这些类内联系,我们进一步开发了一种特征聚合策略,最小化同一类别中掩码部分与可见部分对应特征之间的距离。此外,在语义空间中,我们探索了掩码图像建模在增强正则化方面的应用。在知名基准上的大量实验表明,我们的方法达到了最先进的性能。代码将在 https://github.com/haoxt/S4MIM 发布。
引用
@article{arxiv.2411.08756,
title = {Masked Image Modeling Boosting Semi-Supervised Semantic Segmentation},
author = {Yangyang Li and Xuanting Hao and Ronghua Shang and Licheng Jiao},
journal= {arXiv preprint arXiv:2411.08756},
year = {2024}
}
备注
13 pages. This work has been submitted to the IEEE for possible publication