预训练目标在极端低数据 FGVC 中至关重要:一项骨干网络控制研究
计算机视觉与模式识别
2026-05-20 v2 人工智能
摘要
在标注成本高昂的专家领域,极端低数据细粒度分类很常见,但实践者仍需要原则性指导来选择预训练编码器。我们使用一个包含三个类别的自定义标注图像数据集研究祖母绿内含物分级,并探讨:在匹配的骨干网络容量下,预训练目标如何影响下游表示质量?我们比较了四个冻结的 ViT-B/16 编码器,它们分别通过监督分类、对比学习(SigLIP2)、掩码重建(MAE)和自蒸馏(DINOv3)进行训练,并使用线性与非线性探针通过留一法交叉验证进行评估。为了控制低样本量下的统计噪声,我们对宏观一对多 AUC 使用置换检验(N=1000)。监督和对比编码器提供了最强的线性可分性(逻辑回归 AUC:0.768 和 0.735;SVM AUC:0.739 和 0.697),而 MAE 在非线性探针下表现有所提升(XGBoost AUC:0.713)。我们发现 DINOv3 在此领域的各类探针下均表现不佳。这些结果为极端低数据 FGVC 提供了一个实用建议:当数据稀缺限制只能使用线性决策规则时,优先考虑增强边界的预训练目标;当数据集约束允许使用非线性分类器时,可考虑重建式编码器。
引用
@article{arxiv.2605.15599,
title = {Pretraining Objective Matters in Extreme Low-Data FGVC: A Backbone-Controlled Study},
author = {Alexander Hackett and Srikanth Thudumu and Ginny Fisher and Jason Fisher},
journal= {arXiv preprint arXiv:2605.15599},
year = {2026}
}
备注
Presented at the 13th Workshop on Fine-Grained Visual Categorization (FGVC13) at CVPR 2026