中文

最优深度网络——使模型深度适配数据集以实现卓越效率

机器学习 2025-11-26 v4 人工智能 计算机视觉与模式识别

摘要

深度神经网络(DNNs)在各种任务上取得了卓越的性能。然而,这种成功往往以不必要的庞大模型规模、高计算需求和巨大的内存占用为代价。通常,强大的架构以全深度进行训练,但并非所有数据集或任务都需要如此高的模型容量。在相对低复杂度的数据集上训练又大又深的架构,常常导致计算浪费、不必要的能耗以及过度的内存使用,从而使模型在资源受限设备上的部署变得不切实际。为解决这一问题,我们引入了最优深度网络(Optimally Deep Networks, ODNs)的概念,在模型深度与任务复杂度之间提供平衡。具体而言,我们提出了一种类似 NAS 的训练策略,称为渐进深度扩展(progressive depth expansion),它从较浅的深度开始训练神经网络,并随着早期块收敛而逐步增加其深度,持续此过程直至达到目标准确率。ODNs 仅针对手头任务使用最优深度,去除冗余层。这削减了未来的训练和推理成本,降低了模型内存占用,提升了计算效率,并便于在边缘设备上部署。实验结果表明,ResNet-18 和 ResNet-34 针对 MNIST 和 SVHN 的最优深度,在保持 99.31% 和 96.08% 的竞争性准确率的同时,分别实现了高达 98.64% 和 96.44% 的内存占用缩减。

关键词

引用

@article{arxiv.2510.10764,
  title  = {Optimally Deep Networks -- Adapting Model Depth to Datasets for Superior Efficiency},
  author = {Shaharyar Ahmed Khan Tareen and Filza Khan Tareen},
  journal= {arXiv preprint arXiv:2510.10764},
  year   = {2025}
}

备注

6 pages, 4 figures, 1 table, 2 equations, 1 algorithm