中文

用于弱监督少样本分类与分割的自监督视觉 Transformer 蒸馏

计算机视觉与模式识别 2023-07-10 v1

摘要

我们通过利用以自监督预训练的视觉 Transformer(ViT)来解决弱监督少样本图像分类与分割任务。我们提出的方法取自自监督 ViT 的 token 表示,并通过自注意力利用它们之间的相关性,经由独立的任务头产生分类与分割预测。我们的模型能够在训练期间缺乏像素级标签、仅使用图像级标签的情况下有效学习执行分类与分割。为此,它使用由自监督 ViT 主干生成的 token 所创建的注意力图作为像素级伪标签。我们还探索了一种带有“混合”监督的实用设置,其中少量训练图像包含真值像素级标签,其余图像仅有图像级标签。针对该混合设置,我们提出使用借助可用真值像素级标签训练的伪标签增强器来改进伪标签。在 Pascal-5i 和 COCO-20i 上的实验表明,在多种监督设置下尤其是几乎无像素级标签可用时,性能有显著提升。

关键词

引用

@article{arxiv.2307.03407,
  title  = {Distilling Self-Supervised Vision Transformers for Weakly-Supervised Few-Shot Classification & Segmentation},
  author = {Dahyun Kang and Piotr Koniusz and Minsu Cho and Naila Murray},
  journal= {arXiv preprint arXiv:2307.03407},
  year   = {2023}
}

备注

Accepted at CVPR 2023