中文

SWNet:小世界神经网络与快速收敛

机器学习 2019-04-11 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

训练大型且高精度的深度学习(DL)模型在计算上代价高昂。这一成本很大程度上源于过多的训练参数,众所周知这些参数在执行阶段是冗余且可压缩的。本文提出了一种新颖的变换,改变 DL 架构的拓扑结构,使其达到最优的跨层连接。该变换利用了我们的一个重要观察:在给定精度水平下,当网络拓扑达到小世界网络的边界时收敛最快。小世界图已知具有特定的连接结构,能够增强节点间的信号传播。我们的小世界模型称为 SWNets,提供了若干引人注目的好处:它们促进网络内的数据(梯度)流动,通过添加长程连接实现特征图重用,并适配各种网络架构/数据集。与密集连接网络(例如 DenseNets)相比,SWNets 在保持相似分类精度水平的同时,所需训练参数数量大幅减少。我们在多种 DL 模型架构和图像分类数据集(即 CIFAR10、CIFAR100 和 ILSVRC(ImageNet))上评估了我们的网络。我们的实验表明,达到期望精度的收敛速度平均提升约 2.1 倍。

关键词

引用

@article{arxiv.1904.04862,
  title  = {SWNet: Small-World Neural Networks and Rapid Convergence},
  author = {Mojan Javaheripi and Bita Darvish Rouhani and Farinaz Koushanfar},
  journal= {arXiv preprint arXiv:1904.04862},
  year   = {2019}
}