中文

自然世界图像集合的表示学习基准测试

计算机视觉与模式识别 2021-06-10 v2

摘要

自监督学习的最新进展产生了能够从图像集合中抽取丰富表示而无需任何显式标签监督的模型。然而,迄今为止这些方法中绝大多数都局限于在标准基准数据集(如 ImageNet)上训练。我们认为细粒度视觉分类问题,例如植物和动物物种分类,为自监督学习提供了信息丰富的测试平台。为了促进该领域的进展,我们提出了两个新的自然世界视觉分类数据集:iNat2021 和 NeWT。前者由使用公民科学应用 iNaturalist 的用户上传的来自 10k 个不同物种的 2.7M 图像组成。我们与领域专家合作设计了后者 NeWT,旨在对表示学习算法在一组超越标准物种分类的挑战性自然世界二分类任务上的性能进行基准测试。这两个新数据集使我们能够探索细粒度类别背景下与大规模表示和迁移学习相关的问题。我们对在 ImageNet 和 iNat2021 上以有监督和无监督方式训练的特征提取器进行了全面分析,揭示了不同所学特征在多样化任务上的优势与不足。我们发现标准监督方法产生的特征仍优于 SimCLR 等自监督方法产生的特征。然而,改进的自监督学习方法不断被提出,iNat2021 和 NeWT 数据集是追踪其进展的宝贵资源。

关键词

引用

@article{arxiv.2103.16483,
  title  = {Benchmarking Representation Learning for Natural World Image Collections},
  author = {Grant Van Horn and Elijah Cole and Sara Beery and Kimberly Wilber and Serge Belongie and Oisin Mac Aodha},
  journal= {arXiv preprint arXiv:2103.16483},
  year   = {2021}
}

备注

CVPR 2021