中文

少类竞技场:高效视觉模型选择与数据集难度测量的基准测试

计算机视觉与模式识别 2025-03-04 v2

摘要

我们提出少类竞技场(FCA),作为一个统一基准,专注于测试面向少类别的高效图像分类模型。已创建多种含大量类别(80-1000类)的基准数据集以辅助计算机视觉架构的演进。越来越多的视觉模型使用这些多类数据集进行评估。然而,真实世界应用通常仅涉及显著更少的感兴趣类别(2-10类)。多类与少类之间的差距使得难以利用在多类数据集上训练的模型预测少类应用的性能。截至目前,很少有工具可用于评估少类设定下的模型。我们对从2类到1000类的ImageNet子集上训练的ResNet系列进行了系统性评估,并使用新提出的FCA工具在十个数据集上测试了广泛的卷积神经网络与Transformer架构。此外,为辅助数据集难度的前期评估和更高效的模型选择,我们引入了一个以类别相似度为函数的难度度量。FCA为少类设定下的高效机器学习提供了新工具,目标涵盖从新的高效类别相似性提议、轻量级模型架构设计到新的缩放定律。FCA用户友好,可轻松扩展至新模型和新数据集,促进未来研究工作。我们的基准测试位于 https://github.com/bryanbocao/fca。

关键词

引用

@article{arxiv.2411.01099,
  title  = {Few-Class Arena: A Benchmark for Efficient Selection of Vision Models and Dataset Difficulty Measurement},
  author = {Bryan Bo Cao and Lawrence O'Gorman and Michael Coss and Shubham Jain},
  journal= {arXiv preprint arXiv:2411.01099},
  year   = {2025}
}

备注

10 pages, 32 pages including References and Appendix, 19 figures, 8 tables