在五个异构图像数据集上训练自定义 CNN
计算机视觉与模式识别
2026-01-09 v1 神经与进化计算
摘要
深度学习已经改变了视觉数据分析,其中卷积神经网络 (CNN) 在直接从图像中学习有意义的特征表示方面变得极为有效。不同于传统的手工特征工程方法,CNN 自动提取层次化的视觉模式,从而在多样化的现实场景中实现了优异的性能。本研究调查了基于 CNN 的架构在跨越农业和城市领域的五个异构数据集上的有效性:芒果品种分类、水稻品种识别、路面状况评估、自动人力车检测以及人行道侵占监测。这些数据集带来了不同的挑战,包括光照、分辨率、环境复杂性和类别不平衡方面的差异,需要具有适应性和鲁棒性的学习模型。我们评估了一个轻量级的、特定任务的自定义 CNN,以及包括 ResNet-18 和 VGG-16 在内的成熟深度架构,分别采用从头开始训练和迁移学习进行训练。通过系统的预处理、数据增强和受控实验,我们分析了架构复杂性、模型深度和预训练如何在不同规模和难度的数据集上影响收敛、泛化和性能。本研究的主要贡献是:(1) 开发了一个在多个应用领域取得有竞争力性能的高效自定义 CNN;(2) 进行了全面的比较分析,突出了迁移学习和深度架构何时能提供显著优势,特别是在数据受限的环境中。这些发现为在资源有限但高影响力的现实视觉分类任务中部署深度学习模型提供了实用见解。
引用
@article{arxiv.2601.04727,
title = {Training a Custom CNN on Five Heterogeneous Image Datasets},
author = {Anika Tabassum and Tasnuva Mahazabin Tuba and Nafisa Naznin},
journal= {arXiv preprint arXiv:2601.04727},
year = {2026}
}