中文

AdderNet:深度学习中我们真的需要乘法吗?

计算机视觉与模式识别 2021-07-13 v6

摘要

与廉价的加法操作相比,乘法操作的计算复杂度要高得多。深度神经网络中广泛使用的卷积正是互相关,用以度量输入特征与卷积滤波器之间的相似性,其间涉及浮点值之间的大量乘法。本文提出加法器网络(AdderNets),将深度神经网络(尤其是卷积神经网络(CNNs))中这些大量乘法替换为更廉价的加法以降低计算成本。在 AdderNets 中,我们取滤波器与输入特征之间的 1\ell_1 范数距离作为输出响应。这种新相似性度量对神经网络优化的影响已被透彻分析。为获得更好性能,我们通过考察全精度梯度为 AdderNets 开发了特殊的反向传播方法。进而提出自适应学习率策略,依据各神经元梯度的大小来增强 AdderNets 的训练过程。结果表明,所提 AdderNets 在 ImageNet 数据集上利用 ResNet-50 可实现 74.9% 的 Top-1 准确率与 91.7% 的 Top-5 准确率,且卷积层中无任何乘法。代码已公开于:https://github.com/huaweinoah/AdderNet。

关键词

引用

@article{arxiv.1912.13200,
  title  = {AdderNet: Do We Really Need Multiplications in Deep Learning?},
  author = {Hanting Chen and Yunhe Wang and Chunjing Xu and Boxin Shi and Chao Xu and Qi Tian and Chang Xu},
  journal= {arXiv preprint arXiv:1912.13200},
  year   = {2021}
}

备注

New version in arXiv:2105.14202