动态稀疏性即通道级稀疏性学习器
机器学习
2023-11-13 v2 人工智能
计算机视觉与模式识别
摘要
稀疏训练因其在整个训练过程及推理中诱人的节省潜力而在机器学习领域受到日益增加的关注。动态稀疏训练(DST)作为一种领先的稀疏训练方法,能够从高稀疏度出发从头训练深度神经网络,以匹配其稠密对应模型的性能。然而,绝大多数(即便不是全部)DST已有工作均在具有高度不规则稀疏模式的非结构化稀疏上展示其有效性,而这类模式在通用硬件中得到的支持有限。这一局限阻碍了DST在实际中的使用。本文提出通道感知动态稀疏(Chase),首次在端到端训练过程中将非结构化动态稀疏的潜力无缝转化为对GPU友好的通道级稀疏(而非细粒度N:M或组稀疏),且无需任何临时操作。所得的小型稀疏网络可直接由商用硬件加速,无需使用任何特定的稀疏感知硬件加速器。这一引人注目的结果部分源于动态稀疏的一个隐藏现象:现成的非结构化DST隐式地涉及跨通道的有偏参数重分配,其中很大一部分通道(高达60%)比其他通道更稀疏。通过在训练中逐步识别并移除这些通道,我们的方法将非结构化稀疏转化为通道级稀疏。实验结果表明,在ImageNet上使用ResNet-50时,Chase在通用GPU设备上实现了1.7倍推理吞吐加速且不损失精度。我们的代码发布于https://github.com/luuyin/chase。
引用
@article{arxiv.2305.19454,
title = {Dynamic Sparsity Is Channel-Level Sparsity Learner},
author = {Lu Yin and Gen Li and Meng Fang and Li Shen and Tianjin Huang and Zhangyang Wang and Vlado Menkovski and Xiaolong Ma and Mykola Pechenizkiy and Shiwei Liu},
journal= {arXiv preprint arXiv:2305.19454},
year = {2023}
}
备注
Accepted by the 37th Conference on Neural Information Processing Systems (NeurIPS 2023)