中文

SELECT:面向图像分类的数据 curated 策略大规模基准

计算机视觉与模式识别 2024-10-08 v1 机器学习

摘要

数据 curated 是指如何收集和组织样本以生成支持高效学习的数据集的问题。尽管该任务至关重要,但为数不多的工作致力于大规模、系统性地比较各种curation方法。本文致力于正式评估数据curation策略,提出SELECT:首个面向图像分类的数据curation策略大规模基准。为生成SELECT基准的基线方法,我们创建了一个新数据集ImageNet++,该数据集是目前为数最大的ImageNet-1K超集。该数据集将ImageNet扩展为5个新的训练数据偏移,每个偏移约为ImageNet-1K规模,且每个均采用不同的curation策略组装。我们两种方式评估数据curation基线:(i) 使用每个训练数据偏移从头开始训练相同的图像分类模型;(ii) 使用数据本身拟合预训练的自监督表示。我们的发现表明,特别是针对近期数据curation方法(如合成数据生成和基于CLIP嵌入的查找)的趋势尤为有趣。我们表明,尽管这些策略在特定任务中高度具竞争力,然而用于组装原始ImageNet-1K数据集的curation策略仍是黄金标准。我们预计该基准可以阐明新方法以进一步缩小差距的路径。我们发布了模型检查点、代码、文档以及数据集链接:https://github.com/jimmyxu123/SELECT。

关键词

引用

@article{arxiv.2410.05057,
  title  = {SELECT: A Large-Scale Benchmark of Data Curation Strategies for Image Classification},
  author = {Benjamin Feuer and Jiawei Xu and Niv Cohen and Patrick Yubeaton and Govind Mittal and Chinmay Hegde},
  journal= {arXiv preprint arXiv:2410.05057},
  year   = {2024}
}

备注

NeurIPS 2024, Datasets and Benchmarks Track