中文

S2-UniSeg:用于无监督可扩展分割一切模型的快速通用凝聚池化

计算机视觉与模式识别 2025-08-15 v2

摘要

最近的自监督图像分割模型在语义分割和类别无关的实例分割上取得了有前景的性能。然而,它们的预训练流程是多阶段的,需要在每个训练周期之间进行耗时的伪掩码生成过程。这种耗时的离线过程不仅使其难以随训练数据集规模扩展,而且由于其不连续的优化流程导致次优解。为了解决这些问题,我们首先提出了一种新颖的伪掩码算法——快速通用凝聚池化(UniAP)。UniAP 的每一层可以并行识别相似节点的组,从而能够在几十毫秒内为一张图像生成语义级、实例级和多粒度的伪掩码。基于快速的 UniAP,我们提出了可扩展的自监督通用分割模型(S2-UniSeg),它采用一个学生网络和一个动量教师网络进行连续预训练。我们提出了一种新颖的面向分割的预训练任务——查询式自蒸馏(QuerySD),以预训练 S2-UniSeg 学习局部到全局的对应关系。在相同设置下,S2-UniSeg 优于当前最优的 UnSAM 模型,在 COCO 上实现了 AP+6.9,在 UVO 上实现了 AR+11.1,在 COCOStuff-27 上实现了 PixelAcc+4.5,在 Cityscapes 上实现了 RQ+8.0 的显著提升。在扩展到更大的 200 万张图像的 SA-1B 子集后,S2-UniSeg 在所有四个基准上进一步实现了性能提升。我们的代码和预训练模型可在 https://github.com/bio-mlhui/S2-UniSeg 获取。

关键词

引用

@article{arxiv.2508.06995,
  title  = {S2-UniSeg: Fast Universal Agglomerative Pooling for Scalable Segment Anything without Supervision},
  author = {Huihui Xu and Jin Ye and Hongqiu Wang and Changkai Ji and Jiashi Lin and Ming Hu and Ziyan Huang and Ying Chen and Chenglong Ma and Tianbin Li and Lihao Liu and Junjun He and Lei Zhu},
  journal= {arXiv preprint arXiv:2508.06995},
  year   = {2025}
}