中文

GXNOR-Net:在统一离散化框架下无需全精度内存训练具有三值权重和激活的深度神经网络

机器学习 2018-05-03 v5 计算机视觉与模式识别 机器学习

摘要

迫切需要构建一种架构,将这些网络纳入一个统一的框架,以实现更高的性能和更少的开销。为此,有两个基本问题尚待解决。第一个是如何在神经元激活为离散值时实现反向传播。第二个是如何在训练阶段移除全精度的隐藏权重,以打破内存/计算消耗的瓶颈。为了解决第一个问题,我们提出了一种多步神经元激活离散化方法和一种导数近似技术,使得能够在离散DNN上实现反向传播算法。而对于第二个问题,我们提出了一种离散状态转换(DST)方法,在不保存隐藏权重的情况下将权重约束在离散空间中。通过这种方式,我们构建了一个统一的框架,将二值或三值网络作为其特例,并在该框架下提供了一个启发式算法,网址为https://github.com/AcrossV/Gated-XNOR。更特别地,我们发现当权重和激活都变为三值时,DNN可以简化为稀疏的二值网络,称为门控XNOR网络(GXNOR-Nets),因为只有非零权重和非零激活的事件才能使控制门启动原始二值网络中的XNOR逻辑运算。这为高效的移动智能预示了事件驱动的硬件设计。与最先进的算法相比,我们取得了先进的性能。此外,计算稀疏性和离散空间中的状态数可以灵活修改,使其适用于各种硬件平台。

关键词

引用

@article{arxiv.1705.09283,
  title  = {GXNOR-Net: Training deep neural networks with ternary weights and activations without full-precision memory under a unified discretization framework},
  author = {Lei Deng and Peng Jiao and Jing Pei and Zhenzhi Wu and Guoqi Li},
  journal= {arXiv preprint arXiv:1705.09283},
  year   = {2018}
}

备注

11 pages, 13 figures