中文

NamedMask:从互补基础模型蒸馏分割器

计算机视觉与模式识别 2022-09-23 v1 人工智能 机器学习

摘要

本工作的目标是在训练时无需像素级标签的情况下分割并命名图像区域。为应对该任务,我们通过蒸馏两个基础模型的互补优势来构建分割器。第一个模型 CLIP(Radford 等人,2021)具备为图像内容命名的能力,但缺乏可获取的物体结构表示。第二个模型 DINO(Caron 等人,2021)捕捉物体的空间范围,却不知物体名称。我们提出的方法称为 NamedMask,首先利用 CLIP 构建类别特定的图像档案。这些图像由基于 DINO 引导的类别无关显著物体检测器生成伪标签,随后利用 CLIP 档案标签通过类别特定分割器进行精炼。得益于精炼掩码的高质量,我们表明在此类档案上以适当数据增强训练的标准分割架构,对单物体与多物体图像均取得了令人瞩目的语义分割能力。因此,我们提出的 NamedMask 在包括 VOC2012、COCO 及大规模 ImageNet-S 数据集在内的五个基准上,相较一系列已有工作表现优异。

关键词

引用

@article{arxiv.2209.11228,
  title  = {NamedMask: Distilling Segmenters from Complementary Foundation Models},
  author = {Gyungin Shin and Weidi Xie and Samuel Albanie},
  journal= {arXiv preprint arXiv:2209.11228},
  year   = {2022}
}

备注

Tech report. Code: https://github.com/NoelShin/namedmask