构建高效轻量级 CNN 模型
计算机视觉与模式识别
2025-01-28 v1 人工智能
机器学习
摘要
卷积神经网络(CNN)因其强大的特征提取能力在图像分类任务中占据重要位置。然而,其高计算和内存要求在资源受限的环境中构成部署挑战。本文引入一种方法,在保持竞争性精度的同时构建轻量级 CNN。该方法集成了两个训练阶段:双输入输出模型和带有渐进解冻的迁移学习。双输入输出模型在原始数据和增强数据上进行训练,提高了鲁棒性。对统一模型应用渐进解冻,以在微调期间优化预学习特征,实现更快的收敛和 improved 模型精度。该方法在三大基准数据集上进行评估:手写数字 MNIST、时尚 MNIST 和 CIFAR-10。所提出的模型在手写数字 MNIST 上实现了 99% 的最高精度,在时尚 MNIST 上达到 89%,仅使用 14,862 个参数,模型大小为 0.17 MB。尽管在 CIFAR-10 上的性能较低(65%,参数不足 20,000),但结果凸显了该方法的可扩展性。最终模型显示出快速的推理速度和低延迟,适用于实时应用。未来方向包括探索更先进的增强技术、改进架构可扩展性以适应复杂数据集,以及将该方法扩展到分类之外的任务。该研究彰显了在多样化应用中创建高效、可扩展且具有任务特性的 CNN 的潜力。
引用
@article{arxiv.2501.15547,
title = {Building Efficient Lightweight CNN Models},
author = {Nathan Isong},
journal= {arXiv preprint arXiv:2501.15547},
year = {2025}
}
备注
25 pages, 22 figures, 6 tables, JMLR journal standard paper and to be submitted