选择哪个骨干网络:面向计算机视觉的资源高效领域特定比较
计算机视觉与模式识别
2025-03-11 v3 人工智能
机器学习
摘要
在当代计算机视觉应用中,特别是在图像分类任务中,通常采用在ImageNet等大型数据集上预训练的架构骨干网络作为特征提取器。尽管这些预训练卷积神经网络(CNN)被广泛使用,但在不同领域和数据集规模下,各种资源高效骨干网络的性能表现仍存在认知空白。我们的研究在统一的训练设置下,系统评估了多种轻量级预训练CNN骨干网络在包括自然图像、医学图像、星系图像和遥感图像在内的多种数据集上的表现。这项综合分析旨在帮助机器学习从业者为其特定问题选择最合适的骨干网络,尤其是在微调预训练网络至关重要的小数据集场景中。尽管基于注意力的架构日益流行,但我们观察到,在低数据微调任务中,它们的表现往往不如CNN。我们还发现,ConvNeXt、RegNet和EfficientNet等CNN架构在多个不同领域上始终表现优于其他架构。我们的研究结果为不同骨干网络的性能权衡和有效性提供了可操作的见解,有助于在广泛的计算机视觉领域中为模型选择做出明智决策。我们的代码可在此处获取:https://github.com/pranavphoenix/Backbones
引用
@article{arxiv.2406.05612,
title = {Which Backbone to Use: A Resource-efficient Domain Specific Comparison for Computer Vision},
author = {Pranav Jeevan and Amit Sethi},
journal= {arXiv preprint arXiv:2406.05612},
year = {2025}
}
备注
12 pages, 2 figures, accepted in TMLR