中文

SynSeg:面向端到端开放词汇语义分割的多类别对比学习的特征协同

计算机视觉与模式识别 2025-11-18 v2

摘要

由于语义类别的范围和粒度广泛,开放词汇场景下的语义分割面临重大挑战。现有的弱监督方法通常依赖于类别特定的监督和不适合对比学习的特征构建方法,导致语义错位和性能不佳。本文提出了一种新颖的弱监督方法 SynSeg 来应对这些挑战。SynSeg 通过一个名为特征协同结构(FSS)的新特征重建框架,执行多类别对比学习(MCCL)作为更强的训练信号。具体而言,MCCL 策略鲁棒地结合了类别内和类别间的对齐与分离,以使模型学习同一图像内不同类别之间的相关性知识。此外,FSS 通过先验融合和语义激活图增强,为对比学习重建判别性特征,有效避免了视觉编码器引入的前景偏差。此外,SynSeg 是一个轻量级的端到端解决方案,无需使用大规模预训练模型的任何中间输出,并且能够进行实时推理。总体而言,SynSeg 在弱监督下以高效的方式有效提升了语义定位和判别能力。在基准上的大量实验表明,我们的方法优于最先进的(SOTA)性能。特别是,SynSeg 的准确率比 SOTA 基线高出 6.9% 到 26.2%。

关键词

引用

@article{arxiv.2508.06115,
  title  = {SynSeg: Feature Synergy for Multi-Category Contrastive Learning in End-to-End Open-Vocabulary Semantic Segmentation},
  author = {Weichen Zhang and Kebin Liu and Fan Dang and Zhui Zhu and Xikai Sun and Yunhao Liu},
  journal= {arXiv preprint arXiv:2508.06115},
  year   = {2025}
}