中文

Mask-free OVIS:无需人工掩码标注的开集词汇实例分割

计算机视觉与模式识别 2023-03-30 v1

摘要

现有的实例分割模型使用来自基(训练)类别的人工掩码标注学习任务特定信息。这些掩码标注需要巨大的人力,限制了标注新( novel)类别的可扩展性。为缓解该问题,开集词汇(OV)方法利用大规模图文对和视觉-语言模型来学习新类别。总之,OV 方法使用来自基标注的强监督学习任务特定信息,并使用来自图文对的弱监督学习新类别信息。这种强监督与弱监督的差异导致在基类别上过拟合,从而对新类别泛化能力差。在本工作中,我们通过使用我们提出的 Mask-free OVIS 流水线以弱监督方式由视觉-语言模型生成的伪掩码标注来学习基和新类别,克服了该问题。我们的方法通过利用预训练视觉-语言模型对图文对中物体的定位能力自动生成伪掩码标注。生成的伪掩码标注随后用于监督实例分割模型,使整个流水线摆脱任何劳动密集的实例级标注与过拟合。我们大量实验表明,仅用伪掩码训练的我们的方法相比近期用人工掩码训练的 SOTA 方法,在 MS-COCO 数据集和 OpenImages 数据集上显著提升了 mAP 分数。代码和模型见 https://vibashan.github.io/ovis-web/。

关键词

引用

@article{arxiv.2303.16891,
  title  = {Mask-free OVIS: Open-Vocabulary Instance Segmentation without Manual Mask Annotations},
  author = {Vibashan VS and Ning Yu and Chen Xing and Can Qin and Mingfei Gao and Juan Carlos Niebles and Vishal M. Patel and Ran Xu},
  journal= {arXiv preprint arXiv:2303.16891},
  year   = {2023}
}

备注

Accepted to CVPR 2023. Project site: https://vibashan.github.io/ovis-web/