卷积神经网络何时停止学习?
计算机视觉与模式识别
2024-03-06 v1
摘要
卷积神经网络 (CNN) 在图像分类、检测、分割及医学图像分析等计算机视觉任务中展现出卓越性能。通常,此类神经网络的训练采用任意数量的 epoch。在一个 epoch 中,整个训练数据按批量大小 (batch size) 划分后输入网络。实践中,利用验证误差与训练损失来估计神经网络的泛化能力,从而指示网络的最佳学习容量。当前的做法是:当训练损失下降且训练误差与验证误差之间的差距(即泛化差距)增大时停止训练,以避免过拟合。然而,这是一种基于试错的方法,引发了一个关键问题:是否可能仅基于训练数据来估计神经网络何时停止学习?本研究提出了一种假设,通过分析 CNN 变体所有层的数据变化来预测其近优学习容量。在训练阶段,我们利用该假设在不使用任何验证数据的情况下预测 CNN 变体的近优学习容量。我们的假设可作为即插即用模块部署于任何现有的 CNN 变体,且无需向网络引入额外的可训练参数。我们在六种不同的 CNN 变体和三个通用图像数据集(CIFAR10、CIFAR100 和 SVHN)上测试了该假设。基于这些 CNN 变体和数据集的结果表明,我们的假设平均节省了 58.49% 的训练计算时间。我们进一步在十个医学图像数据集上验证了该假设,并与 MedMNIST-V2 基准进行了比较。实验结果表明,与 MedMNIST-V2 基准相比,我们在不损失精度的情况下节省了约 44.1% 的计算时间。
引用
@article{arxiv.2403.02473,
title = {When do Convolutional Neural Networks Stop Learning?},
author = {Sahan Ahmad and Gabriel Trahan and Aminul Islam},
journal= {arXiv preprint arXiv:2403.02473},
year = {2024}
}