中文

CAST:用于半监督实例分割的对比自适应与蒸馏

计算机视觉与模式识别 2025-10-10 v4 人工智能

摘要

实例分割需要昂贵的逐像素标注和计算代价高昂的模型。我们引入了 CAST,这是一个半监督知识蒸馏(SSKD)框架,利用有限的标注数据和大量未标注数据,将预训练的视觉基础模型(VFM)压缩为紧凑的专家模型。CAST 分为三个阶段展开:(1) 通过带有对比校准的自训练对 VFM 进行领域自适应,(2) 通过统一的多目标损失进行知识迁移,(3) 对学生模型进行精调以缓解残余的伪标签偏差。CAST 的核心是一个实例感知的像素级对比损失,它融合掩码和类别分数以提取信息丰富的负样本,并强制执行清晰的实例间边界。通过在自适应和蒸馏过程中均维持该对比信号,我们对齐了教师和学生的嵌入,并充分利用了未标注图像。在 Cityscapes 和 ADE20K 上,体积缩小约 11 倍的学生模型相较于其零样本 VFM 教师模型提升了 +8.5 和 +7.1 AP,超越了自适应后的教师模型 +3.4 和 +1.5 AP,并在这两个基准上进一步优于 SOTA 的 SSKD 方法。

关键词

引用

@article{arxiv.2505.21904,
  title  = {CAST: Contrastive Adaptation and Distillation for Semi-Supervised Instance Segmentation},
  author = {Pardis Taghavi and Tian Liu and Renjie Li and Reza Langari and Zhengzhong Tu},
  journal= {arXiv preprint arXiv:2505.21904},
  year   = {2025}
}