稀疏度可控的三元权值网络
机器学习
2021-10-25 v2
摘要
深度神经网络(DNNs)已广泛且成功地应用于各种应用,但它们需要大量内存和计算能力。这严重限制了它们在资源受限设备上的部署。为解决此问题,许多工作致力于训练低比特权值 DNNs。本文中,我们专注于训练三元权值 \{-1, 0, +1\} 网络,其可避免乘法并大幅降低内存与计算需求。三元权值网络可视为二元权值网络的更稀疏版本,通过将二元权值中的一些 -1 或 1 替换为 0 得到,从而带来更高效的推理但更高的内存成本。然而,现有的三元权值网络训练方法无法控制三元权值的稀疏度(即 0 的百分比),这削弱了三元权值的优势。本文中,我们提出了据我们所知首个用于训练三元权值网络的稀疏度控制方法(SCA),其通过权值离散化正则化器(WDR)简单实现。SCA 不同于所有现有的基于正则化的方法,因为它可通过控制器 控制三元权值的稀疏度且不依赖梯度估计器。我们从理论和实验上表明,训练得到的三元权值的稀疏度与 正相关。SCA 极其简单、易于实现,并在多个基准数据集上被证明持续显著优于当前最佳方法,甚至匹配全精度权值对应模型的性能。
引用
@article{arxiv.2011.00580,
title = {Sparsity-Control Ternary Weight Networks},
author = {Xiang Deng and Zhongfei Zhang},
journal= {arXiv preprint arXiv:2011.00580},
year = {2021}
}
备注
version 1 of SCA; accepted by journal "Neural Networks"; the final version could be a little different from this version