中文

通过鲁棒跨模态伪标签实现开放词汇实例分割

计算机视觉与模式识别 2022-04-20 v2

摘要

开放词汇实例分割旨在无需掩码标注的情况下分割新类别。这是减少繁重人工监督的重要一步。现有大多数工作首先在覆盖许多新类别的带标题图像上预训练模型,然后在有限的带有掩码标注的基类上进行微调。然而,仅从标题预训练中学习到的高层文本信息无法有效编码像素级分割所需的细节。为了解决这个问题,我们提出了一个跨模态伪标签框架,该框架通过将标题中的词语义与图像中物体掩码的视觉特征对齐来生成训练伪掩码。因此,我们的框架能够通过其词语义为标题中的新类别打标签,从而自训练一个学生模型。为了应对伪掩码中的噪声,我们设计了一个鲁棒的学生模型,通过估计掩码噪声水平来选择性地蒸馏掩码知识,从而减轻噪声伪掩码的不利影响。通过大量实验,我们展示了我们框架的有效性,与现有最优方法相比,我们在MS-COCO上显著提升了4.5%的mAP分数,在大规模Open Images & Conceptual Captions数据集上提升了5.1%。

关键词

引用

@article{arxiv.2111.12698,
  title  = {Open-Vocabulary Instance Segmentation via Robust Cross-Modal Pseudo-Labeling},
  author = {Dat Huynh and Jason Kuen and Zhe Lin and Jiuxiang Gu and Ehsan Elhamifar},
  journal= {arXiv preprint arXiv:2111.12698},
  year   = {2022}
}