中文

用于无标签图像分类的掩码无监督自训练

计算机视觉与模式识别 2023-03-13 v2 人工智能

摘要

最先进的计算机视觉模型大多通过使用人工标注图像的有监督学习训练,因标注成本高昂而限制了可扩展性。尽管自监督表示学习已取得令人瞩目的进展,仍需要第二阶段在标注数据上微调。另一方面,使用大规模文本-图像监督(如 CLIP)预训练的模型已实现向下游图像分类任务的零样本迁移。然而,类 CLIP 模型的零样本性能往往不足以在实际中采用。本文旨在利用目标域中丰富的无标签数据,通过对预训练模型的无监督微调,提升预训练零样本分类器的性能。我们提出掩码无监督自训练(MUST),一种利用两种不同且互补训练信号(伪标签与原始图像)的新无监督自适应方法。MUST 联合优化三个目标,以同时学习类别级全局特征与像素级局部特征,并在二者间施加正则化。我们在多种下游任务上展示了 MUST 的有效性,其大幅优于 CLIP。MUST 也胜过有监督少样本自适应方法:在 ImageNet 上使用 ViT-B 取得 77.7% 的 top-1 准确率,比 CLIP 高 +9.4%,比 16-shot CLIP 自适应高 +6.2%。我们的代码见 https://github.com/salesforce/MUST。

关键词

引用

@article{arxiv.2206.02967,
  title  = {Masked Unsupervised Self-training for Label-free Image Classification},
  author = {Junnan Li and Silvio Savarese and Steven C. H. Hoi},
  journal= {arXiv preprint arXiv:2206.02967},
  year   = {2023}
}