中文

自定义 CNN 架构与预训练模型及迁移学习的比较分析:巴基斯坦五个数据集上的实验研究

计算机视觉与模式识别 2026-01-09 v1 机器学习

摘要

本研究对自定义构建的卷积神经网络 (CNN) 与流行预训练架构 (ResNet-18 和 VGG-16) 进行了全面比较分析,采用特征提取和迁移学习两种方法。我们在来自巴基斯坦的五个多样化图像分类数据集上评估了这些模型:Footpath Vision、Auto Rickshaw Detection、Mango Image Classification、Paddy Variety Recognition 和 Road Damage Detection。我们的实验结果表明,迁移学习与微调始终优于从头构建的自定义 CNN 以及特征提取方法,在不同数据集之间实现了 3% 到 76% 的准确率提升。值得注意的是,ResNet-18 采用微调在 Road Damage BD 数据集上实现了完美的 100% 准确率。虽然自定义 CNN 在模型大小 (3.4M 参数 vs. 11-134M) 和简单任务上的训练效率方面具有优势,但预训练模型与迁移学习在资源受限的复杂分类任务上提供了卓越的性能。该研究为实践者提供了在数据集特征、计算资源和性能要求之间做出合适选择的实用见解。

关键词

引用

@article{arxiv.2601.04352,
  title  = {Comparative Analysis of Custom CNN Architectures versus Pre-trained Models and Transfer Learning: A Study on Five Bangladesh Datasets},
  author = {Ibrahim Tanvir and Alif Ruslan and Sartaj Solaiman},
  journal= {arXiv preprint arXiv:2601.04352},
  year   = {2026}
}