中文

PENNI:用于高效CNN推理的剪枝核共享

计算机视觉与模式识别 2020-06-26 v2

摘要

尽管最先进的(SOTA)CNN在各种任务上取得了卓越性能,但其高计算需求与海量参数使得将这些SOTA CNN部署到资源受限设备十分困难。已有的CNN加速工作利用原始卷积层的低秩近似来降低计算成本。然而,这些方法很难在稀疏模型上实施,限制了执行加速,因为CNN模型内的冗余未被充分利用。我们认为,在低秩假设下可进行核粒度分解,同时利用剩余紧凑系数中的冗余。基于该观察,我们提出PENNI,一种CNN模型压缩框架,能够通过(1)以少量基核在卷积层中实现核共享,以及(2)交替调整基与带稀疏约束的系数,同时实现模型紧凑性与硬件效率。实验表明,在ResNet18 CIFAR10上我们可剪枝97%参数与92% FLOPs且无精度损失,并实现运行时内存消耗减少44%与推理延迟减少53%。

关键词

引用

@article{arxiv.2005.07133,
  title  = {PENNI: Pruned Kernel Sharing for Efficient CNN Inference},
  author = {Shiyu Li and Edward Hanson and Hai Li and Yiran Chen},
  journal= {arXiv preprint arXiv:2005.07133},
  year   = {2020}
}

备注

9 pages, 5 figures, to appear on ICML2020