用于训练二值神经网络的矩阵与张量分解
计算机视觉与模式识别
2019-04-17 v1 人工智能
机器学习
摘要
本文致力于改进激活值和权重均为二值的二值神经网络的训练。先前的神经网络二值化方法独立地对每个滤波器进行二值化,我们则提出使用矩阵或张量分解来参数化每层的权重张量。然后通过量化函数(例如符号函数)应用于重构权重,利用该潜在参数化执行二值化过程。我们方法的一个关键特征是:虽然重构结果被二值化,但潜在分解空间中的计算是在实数域中完成的。这具有若干优势:(i) 潜在分解在二值化之前强制了对滤波器的耦合,显著提升了训练模型的精度。(ii) 虽然在训练时,每个卷积层的二值权重使用实值矩阵或张量分解来参数化,但在推理时我们仅使用重构的(二值)权重。因此,我们的方法在模型压缩和加速推理方面不牺牲二值网络的任何优势。作为进一步贡献,我们提出通过反向传播判别性地学习二值权重缩放因子,而非像先前工作那样解析地计算。最后,我们表明在具有挑战性的任务上,我们的方法显著优于现有方法:(a) 人体姿态估计(提升超过4%)和 (b) ImageNet分类(性能提升高达5%)。
引用
@article{arxiv.1904.07852,
title = {Matrix and tensor decompositions for training binary neural networks},
author = {Adrian Bulat and Jean Kossaifi and Georgios Tzimiropoulos and Maja Pantic},
journal= {arXiv preprint arXiv:1904.07852},
year = {2019}
}