中文

训练百万路实例分类器用于无监督视觉表示学习

计算机视觉与模式识别 2021-02-10 v1 人工智能

摘要

本文提出一种简单的无监督视觉表示学习方法,其 pretext task(预训练任务)是使用参数化、实例级分类器判别数据集中的所有图像。整体框架是有监督分类模型的复刻,其中语义类别(如狗、鸟和船)被实例ID取代。然而,将分类任务从数千个语义标签扩展到数百万个实例标签带来了特定挑战,包括:1)大规模softmax计算;2)因实例样本访问稀少导致的缓慢收敛;3)可能含噪声的海量负类。本工作提出若干新技术应对这些困难。首先,我们引入混合并行训练框架使大规模训练可行。其次,我们提出分类权重的原始特征初始化机制,假设其为例实例判别提供对比先验,并在实验中明显加速收敛。最后,我们提议对少数最难类的标签进行平滑,以避免在非常相似的负对上优化。尽管概念简单,我们的框架在ImageNet线性评估协议及若干下游视觉任务下,相比SOTA无监督方法(即SimCLR、MoCoV2和PIC)取得了有竞争力或更优的性能,验证了全实例分类是许多语义视觉任务的强预训练技术。

关键词

引用

@article{arxiv.2102.04848,
  title  = {Train a One-Million-Way Instance Classifier for Unsupervised Visual Representation Learning},
  author = {Yu Liu and Lianghua Huang and Pan Pan and Bin Wang and Yinghui Xu and Rong Jin},
  journal= {arXiv preprint arXiv:2102.04848},
  year   = {2021}
}

备注

Accepted by AAAI2021