中文

MixReorg:跨模态混合图像块重组是开放世界语义分割的良好掩码学习器

计算机视觉与模式识别 2024-03-14 v2

摘要

近来,以图像级文本监督训练的语义分割模型在具有挑战性的开放世界场景中展现出有前景的结果。然而,这些模型仍面临在像素级学习细粒度语义对齐以及预测准确目标掩码的困难。为解决此问题,我们提出 MixReorg,一种新颖且简洁的语义分割预训练范式,它增强模型重组跨图像混合图像块的能力,探索局部视觉相关性与全局语义一致性。我们的方法通过混合图像块同时保留块与文本之间的对应关系,生成细粒度块-文本对数据。随后训练模型以最小化混合图像的分割损失以及原始与恢复特征的两种对比损失。以 MixReorg 作为掩码学习器,传统的文本监督语义分割模型能够实现高度可泛化的像素-语义对齐能力,这对开放世界分割至关重要。在使用大规模图像-文本数据训练后,MixReorg 模型可直接应用于分割任意类别的视觉对象,无需进一步微调。我们提出的框架在流行的零样本语义分割基准上展现出强劲性能,分别在 PASCAL VOC2012、PASCAL Context、MS COCO 和 ADE20K 上以 5.0%、6.2%、2.5% 和 3.4% mIoU 的显著优势超越 GroupViT。

关键词

引用

@article{arxiv.2308.04829,
  title  = {MixReorg: Cross-Modal Mixed Patch Reorganization is a Good Mask Learner for Open-World Semantic Segmentation},
  author = {Kaixin Cai and Pengzhen Ren and Yi Zhu and Hang Xu and Jianzhuang Liu and Changlin Li and Guangrun Wang and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2308.04829},
  year   = {2024}
}