中文

DEARLi:面向半监督全景分割的识别与定位解耦增强

计算机视觉与模式识别 2025-07-15 v1

摘要

像素级标注昂贵且耗时。半监督分割方法通过在少量标记图像上学习模型,同时利用大规模未标记图像来应对这一挑战。尽管基础模型能够进一步考虑标签稀缺性,但其有效利用机制仍未得到充分探索。我们通过设计一种基于两个专用基础模型的新型半监督全景方法来解决这一问题。通过补充基于 CLIP 特征的零样本分类来增强识别,通过对 SAM 伪标记进行类别无关解码器热身来增强定位。得到的识别与定位解耦增强(DEARLi)在标注数据有限且类别数量大的极具挑战性的半监督场景中表现尤为出色。此外,DEARLi 在不仅仅针对全景目标训练的情况下,还以显著优势超过半监督语义分割的最新方法,仅需原来的 1/8 GPU 内存。我们在仅使用 158 张标记图像的情况下,在 ADE20K 上实现了 29.9 PQ 和 38.9 mIoU。源代码可在 https://github.com/helen1c/DEARLi 获取。

关键词

引用

@article{arxiv.2507.10118,
  title  = {DEARLi: Decoupled Enhancement of Recognition and Localization for Semi-supervised Panoptic Segmentation},
  author = {Ivan Martinović and Josip Šarić and Marin Oršić and Matej Kristan and Siniša Šegvić},
  journal= {arXiv preprint arXiv:2507.10118},
  year   = {2025}
}

备注

ICCV 2025 Findings Workshop