中文

用于神经网络推理中动态计算缩放的不完全点积

机器学习 2017-10-25 v1 计算机视觉与模式识别 机器学习

摘要

我们提出使用不完全点积(IDP)在卷积神经网络的前馈推理过程中动态调整每一层所使用的输入通道数量。不完全点积在训练期间为通道添加单调非增系数,称为“剖面”。该剖面以非增顺序排列每个通道的贡献。在推理时,通过仅选择起始的一个通道子集,可以动态调整所使用的通道数量,以在精度与降低的功耗和减少的延迟之间进行权衡。这种方法允许单个网络在计算范围内动态缩放,而不是训练和部署多个网络来支持不同级别的计算缩放。此外,我们将这一概念扩展到多个剖面,每个剖面针对某个特定的计算缩放范围进行了优化。我们展示了在流行的图像分类模型和数据集上不完全点积的计算与精度权衡实验。我们证明,对于 MNIST 和 CIFAR-10,不完全点积显著降低了计算量,例如降低 75%,而没有显著影响精度。我们认为,不完全点积为设备提供了一种方便且有效的手段,可以根据系统当前的计算预算动态降低计算成本。例如,使用 50% 不完全点积(仅使用前 50% 的通道)的 VGG-16 在 CIFAR-10 数据集上达到了 70% 的精度,而标准网络在使用缩减后的通道集时仅达到 35% 的精度。

关键词

引用

@article{arxiv.1710.07830,
  title  = {Incomplete Dot Products for Dynamic Computation Scaling in Neural Network Inference},
  author = {Bradley McDanel and Surat Teerapittayanon and H. T. Kung},
  journal= {arXiv preprint arXiv:1710.07830},
  year   = {2017}
}