中文

低数据场景下图像分类的视觉背部高效选择

计算机视觉与模式识别 2025-08-20 v2 人工智能 机器学习

摘要

迁移学习已成为现代计算机视觉中至关重要的工具,使实践者能够利用在大型数据集上预训练的 backbone 来训练在有限标注数据下的成功模型。选择合适的 backbone 至关重要,尤其是对于小数据集,因为最终性能高度依赖初始特征表示的质量。虽然先前工作在各种数据集上进行了基准测试以识别通用顶级 backbone,但我们展示了在低数据场景下,backbone 的有效性高度依赖于数据集,尤其是没有单一 backbone 在所有情况下都表现出色。为克服这一限制,我们提出将数据集特定的 backbone 选择作为新的研究方向,并探讨其在低数据场景中的实际可行性。由于在大型 backbone 池中进行全面评估在计算上不可行,因此我们将 Vision Backbone Efficient Selection (VIBES) 形式化为在计算约束下寻找高性能 backbone 的问题。我们定义了解的空间,提出了若干启发式方法,并通过在四个多样化数据集上进行实验,展示了 VIBES 的可行性。我们的实验结果表明,即使是简单的搜索策略,也能在超过 1300 个预训练模型的池子中找到合适的 backbone,且仅用单个 GPU (NVIDIA RTX A5000) 的 10 分钟搜索时间内即可超越通用基准推荐。

关键词

引用

@article{arxiv.2410.08592,
  title  = {Vision Backbone Efficient Selection for Image Classification in Low-Data Regimes},
  author = {Joris Guerin and Shray Bansal and Amirreza Shaban and Paulo Mann and Harshvardhan Gazula},
  journal= {arXiv preprint arXiv:2410.08592},
  year   = {2025}
}

备注

16 pages, 8 figures, Accepted at BMVC 2025