通过持续自监督预训练提升语义分割
计算机视觉与模式识别
2026-01-30 v2
摘要
自监督学习 (SSL) 已成为通过利用大规模无标签数据集训练基础模型的核心范式,通常产生具有强大泛化能力的表示。这些模型通常在 ImageNet 等通用数据集上预训练,然后通过微调适应到各种下游任务。虽然先前的工作已研究针对下游微调的参数组高适应方法,如 adapter、LoRA 和 prompt tuning,但在受限数据下持续地将 SSL 预训练扩展到新领域,尤其是针对下游密集预测任务如语义分割,仍然基本未被探索。本文旨在通过持续自监督预训练来适应面向低数据目标域的视觉基础模型,具体针对下游语义分割。我们提出 GLARE (Global Local and Regional Enforcement),一种新的持续自监督预训练任务,用于增强下游语义分割性能。GLARE 引入 patch 级别的增强,以鼓励局部一致性,并包含一种区域一致性约束,利用数据中的空间语义。对于高效的持续预训练,我们以来已有 SSL 模型的权重初始化 Vision Transformer (ViT),仅更新特定的轻量级 adapter 模块 UniAdapter——同时保持其余 backbone 冻结。在不同领域上的多个语义分割基准实验表明,GLARE 在最小计算和参数开销下一致性地提高了下游性能。
引用
@article{arxiv.2509.17816,
title = {Enhancing Semantic Segmentation with Continual Self-Supervised Pre-training},
author = {Brown Ebouky and Ajad Chhatkuli and Cristiano Malossi and Christoph Studer and Roy Assaf and Andrea Bartezzaghi},
journal= {arXiv preprint arXiv:2509.17816},
year = {2026}
}
备注
23 pages, 5 figures