高质量掩码微调对开放词汇分割的重要性
计算机视觉与模式识别
2025-03-13 v3
摘要
开放词汇图像分割通过掩码生成器与视觉语言模型(如对比语言-图像预训练,CLIP)的协同作用取得了进展。以往方法侧重于生成掩码,并在训练过程中将掩码特征与文本嵌入对齐。在本文中,我们观察到依赖生成的低质量掩码会削弱区域表示中视觉与语言的对齐。这促使我们提出了一种名为 MaskCLIP++ 的新微调框架,该框架使用真实掩码代替生成的掩码,以增强 CLIP 的掩码分类能力。由于带有掩码标注的图像分割数据集多样性有限,我们提出在微调过程中引入一致性对齐原则,以缓解对微调数据集的类别偏置。经过低成本的微调后,MaskCLIP++ 显著提升了在多领域数据集上的掩码分类性能。结合以往基于掩码的开放词汇分割 SOTA 方法中的掩码生成器,我们在 A-847、PC-459、A-150、PC-59 和 PAS-20 数据集上分别取得了 +1.7、+2.3、+2.1、+3.1 和 +0.3 mIoU 的性能提升。代码可在 https://github.com/HVision-NKU/MaskCLIPpp 获取。
引用
@article{arxiv.2412.11464,
title = {High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation},
author = {Quan-Sheng Zeng and Yunheng Li and Daquan Zhou and Guanbin Li and Qibin Hou and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2412.11464},
year = {2025}
}
备注
Revised version according to comments from reviewers of ICLR2025