中文

Mask-Adapter:开放词汇分割中掩码的关键作用

计算机视觉与模式识别 2025-03-11 v2

摘要

最近的开放词汇分割方法采用掩码生成器来预测分割掩码,并利用预训练的视觉-语言模型(例如 CLIP)通过掩码池化对这些掩码进行分类。尽管这些方法显示出有前景的结果,但直观上准确的掩码往往无法通过池化掩码区域内的 CLIP 图像嵌入来获得准确的分类结果。在本文中,我们揭示了掩码池化的性能局限性,并提出了一种简单而有效的方法 Mask-Adapter,以解决开放词汇分割中的这些挑战。与直接使用提议掩码相比,我们提出的 Mask-Adapter 从提议掩码中提取语义激活图,提供更丰富的上下文信息,并确保掩码与 CLIP 的对齐。此外,我们提出了一种掩码一致性损失,鼓励具有相似 IoU 的提议掩码获得相似的 CLIP 嵌入,以增强模型对不同预测掩码的鲁棒性。Mask-Adapter 以即插即用的方式无缝集成到基于掩码池化的开放词汇分割方法中,从而提供更准确的分类结果。在多个零样本基准测试上的广泛实验证明了所提出的 Mask-Adapter 在几种成熟方法上的显著性能提升。值得注意的是,Mask-Adapter 也能有效扩展到 SAM,并在几个开放词汇分割数据集上取得了令人印象深刻的结果。代码和模型可在 https://github.com/hustvl/MaskAdapter 获取。

关键词

引用

@article{arxiv.2412.04533,
  title  = {Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation},
  author = {Yongkang Li and Tianheng Cheng and Bin Feng and Wenyu Liu and Xinggang Wang},
  journal= {arXiv preprint arXiv:2412.04533},
  year   = {2025}
}

备注

Accepted by CVPR 2025; Code & models: https://github.com/hustvl/MaskAdapter