中文

DatUS^2:基于预训练自监督 Vision Transformer 的数据驱动无监督语义分割

计算机视觉与模式识别 2024-11-01 v1 机器学习

摘要

多种自监督训练方案的相继提出,使向通用基础模型的开发更近了一步。在此过程中,无监督下游任务被视为验证自监督训练方案所学视觉特征质量的评估方法之一。然而,无监督密集语义分割尚未作为下游任务被探索,该任务可利用并评估 Vision Transformer 自监督训练期间在块级特征表示中引入的语义信息质量。因此,本文提出了一种作为下游任务的无监督语义分割数据驱动新方法 (DatUS^2)。DatUS^2 在不使用任何视觉先验或同步数据的情况下,为无标签图像数据集生成语义一致且密集的伪标注分割掩码。我们将这些伪标注分割掩码与真值掩码进行比较,以评估近期自监督训练方案在块级学习共享语义属性及在片段级学习判别性语义属性的表现。最后,我们用提出的下游任务 DatUS^2 评估了现有的 SOTA 自监督训练方案。此外,DatUS^2 的最佳版本在 SUIM 数据集上以 15.02% 的 mIoU 和 21.47% 的像素准确率,超越了现有无监督密集语义分割任务的 SOTA 方法。它还在大规模复杂数据集(即 COCO 数据集)上达到了具竞争力的准确率水平。

关键词

引用

@article{arxiv.2401.12820,
  title  = {DatUS^2: Data-driven Unsupervised Semantic Segmentation with Pre-trained Self-supervised Vision Transformer},
  author = {Sonal Kumar and Arijit Sur and Rashmi Dutta Baruah},
  journal= {arXiv preprint arXiv:2401.12820},
  year   = {2024}
}

备注

The manuscript contains 13 pages, 9 figures and 7 tables