基于选择性掩码的自监督学习用于图像语义分割
计算机视觉与模式识别
2025-12-09 v1 机器学习
摘要
本文提出了一种基于选择性掩码图像重建作为预训练任务的语义分割自监督学习方法。所提出的方法取代了大多数掩码图像建模预训练方法中使用的随机掩码增强。所提出的选择性掩码方法通过将图像重建预训练分解为迭代步骤,利用训练模型的知识,选择性地掩码具有最高重建损失的图像块。我们在两个通用数据集(Pascal VOC和Cityscapes)和两个杂草分割数据集(Nassar 2020和Sugarbeets 2016)上表明,所提出的选择性掩码方法在下游分割准确性方面优于传统的随机掩码方法和监督ImageNet预训练,在通用数据集上提升2.9%,在杂草分割数据集上提升2.5%。此外,我们发现选择性掩码方法显著提升了表现最差的类别的准确性。最后,我们表明使用相同的预训练和下游数据集可为低预算自监督预训练带来最佳结果。所提出的选择性掩码图像重建方法为改善端到端语义分割工作流程提供了一种有效且实用的解决方案,尤其适用于需要有限模型容量以满足推理速度和计算资源要求的场景。
引用
@article{arxiv.2512.06981,
title = {Selective Masking based Self-Supervised Learning for Image Semantic Segmentation},
author = {Yuemin Wang and Ian Stavness},
journal= {arXiv preprint arXiv:2512.06981},
year = {2025}
}