学习掩码感知的 CLIP 表征用于零样本分割
计算机视觉与模式识别
2023-10-03 v1 图像与视频处理
摘要
近年来,预训练的视觉-语言模型越来越多地被用于解决具有挑战性的零样本分割任务。典型方案遵循先生成掩码提议再利用 CLIP 进行分类的范式。为了保持 CLIP 的零样本迁移能力,以往做法倾向于在训练时冻结 CLIP。然而,本文揭示 CLIP 对不同掩码提议不敏感,且对同一图像的各种掩码提议倾向于产生相似的预测。这种不敏感性在分类掩码提议时导致大量假阳性。该问题主要源于 CLIP 是在图像级监督下训练的。为缓解此问题,我们提出一种简单而有效的方法,称为掩码感知微调(Mask-aware Fine-tuning, MAFT)。具体而言,提出图像-提议 CLIP 编码器(Image-Proposals CLIP Encoder, IP-CLIP Encoder)来同时处理任意数量的图像与掩码提议。然后,设计掩码感知损失与自蒸馏损失对 IP-CLIP Encoder 进行微调,使 CLIP 对不同的掩码提议具有响应性且不损失迁移能力。如此,掩码感知表征可轻易学习到使真阳性凸显。值得注意的是,我们的方案可在微调过程中无缝插入大多数现有方法且不引入任何新参数。我们在流行的零样本基准上进行了充分实验。借助 MAFT,最先进方法的性能得到大幅提升:在未见类 mIoU 指标上,COCO 达 50.4%(+8.2%),Pascal-VOC 达 81.8%(+3.2%),ADE20K 达 8.7%(+4.3%)。代码见 https://github.com/jiaosiyu1999/MAFT.git。
引用
@article{arxiv.2310.00240,
title = {Learning Mask-aware CLIP Representations for Zero-Shot Segmentation},
author = {Siyu Jiao and Yunchao Wei and Yaowei Wang and Yao Zhao and Humphrey Shi},
journal= {arXiv preprint arXiv:2310.00240},
year = {2023}
}
备注
NeurIPS 2023