中文

粗粒度更优?一种面向未筛选图像自监督学习的新流程

计算机视觉与模式识别 2023-10-02 v3

摘要

大多数自监督学习(SSL)方法通常在满足以物体为中心假设的精选数据集上工作。该假设在未筛选图像中失效。现有的场景图像 SSL 方法试图从原始场景图像中寻找匹配良好或稠密的两个视图,既复杂又计算繁重。本文提出一种概念上不同的流程:首先找出具有充分物体性的粗粒度物体区域,将其裁剪为伪以物体为中心的图像,然后任何 SSL 方法均可如同在真实以物体为中心的数据集中直接应用。即,粗粒度裁剪有益于场景图像 SSL。我们提出了一种生成粗粒度物体框的新颖裁剪策略。新流程与裁剪策略无需 ImageNet 即可从未筛选数据集中学习到高质量特征。实验表明,我们的流程在分类、检测与分割任务上优于现有 SSL 方法(MoCo-v2、DenseCL 和 MAE)。我们进一步进行了大量消融实验以验证:1)该流程不依赖预训练模型;2)该裁剪策略优于现有物体发现方法;3)我们的方法对超参数与数据增强不敏感。

关键词

引用

@article{arxiv.2306.04244,
  title  = {Coarse Is Better? A New Pipeline Towards Self-Supervised Learning with Uncurated Images},
  author = {Ke Zhu and Yin-Yin He and Jianxin Wu},
  journal= {arXiv preprint arXiv:2306.04244},
  year   = {2023}
}