细粒度图像识别中训练与评估设置的准确率与成本权衡的大规模研究
计算机视觉与模式识别
2026-05-19 v1
摘要
先前关于细粒度图像识别(FGIR)的工作已经确立了骨干网络选择的重要性,但忽略了不同训练和评估设置下的准确率与成本权衡。在这项工作中,我们进行了大规模研究,在 6 种训练和评估设置、9 种预训练骨干网络和 17 个数据集上进行了超过 2000 次实验。关于数据增强对细粒度训练有效性的初步观察促使我们扩展了反事实注意力学习(CAL),这是一种基于数据感知裁剪和掩码增强的最先进方法,引入了跨图像判别性区域混合增强。我们还提出了一种高效的仅评估变体,它通过放弃 CAL 和类似 FGIR 方法中通常使用的对判别性裁剪的前向传播,在保持竞争性准确率的同时降低了推理成本。我们的结果表明,仅在训练期间使用数据感知增强即可使模型即使没有裁剪也能达到出色的准确率,从而显著降低推理成本。为了支持未来的研究,我们在以下网址分享我们的代码和检查点:\url{https://github.com/arkel23/FGIR-Backbones}
引用
@article{arxiv.2605.18700,
title = {A Large-Scale Study on the Accuracy vs Cost Trade-offs of Training and Evaluation Settings in Fine-Grained Image Recognition},
author = {Edwin Arkel Rios and Augusto Christian Surya and Oswin Gosal and Fernando Mikael and Mary Madeline Nicole and Kisoon Jang and Bo-Cheng Lai and Min-Chun Hu},
journal= {arXiv preprint arXiv:2605.18700},
year = {2026}
}
备注
Accepted to The 13th Workshop on Fine-Grained Visual Categorization (FGVC13) @ CVPR 2026. Main: 6 pages, 4 figures