中文

利用 Transformer 发现物体掩码以用于无监督语义分割

计算机视觉与模式识别 2022-06-14 v1 机器学习

摘要

无监督语义分割任务旨在将像素聚类为具有语义意义的组。具体而言,分配给同一聚类的像素应共享高级语义属性,如其所属物体或部件类别。本文提出 MaskDistill:一种基于三个关键思想的无监督语义分割新框架。首先,我们倡导一种数据驱动策略来生成物体掩码,作为语义分割的像素分组先验。该方法省略了常为特定场景组合设计并限制竞争框架适用性的手工先验。其次,MaskDistill 对物体掩码聚类以获得伪真值,用于训练初始物体分割模型。第三,我们利用该模型过滤掉低质量物体掩码。该策略减轻了像素分组先验中的噪声,并得到一组干净掩码,用于训练最终分割模型。结合这些组件,我们在 PASCAL(+11% mIoU)和 COCO(+4% mask AP50)上的无监督语义分割表现大幅优于先前工作。有趣的是,与现有方法相反,我们的框架不依附于低级图像线索,且不限于以物体为中心的数据集。代码与模型将公开。

关键词

引用

@article{arxiv.2206.06363,
  title  = {Discovering Object Masks with Transformers for Unsupervised Semantic Segmentation},
  author = {Wouter Van Gansbeke and Simon Vandenhende and Luc Van Gool},
  journal= {arXiv preprint arXiv:2206.06363},
  year   = {2022}
}

备注

Code: https://github.com/wvangansbeke/MaskDistill