中文

理解二值网络训练中的权重幅值超参数

计算机视觉与模式识别 2023-03-07 v1 机器学习

摘要

二值神经网络(BNNs)通过使用二值权重替代实值权重而紧凑高效。当前BNNs在训练中使用潜在实值权重,其中若干训练超参数继承自实值网络。这些超参数的解释基于实值权重的幅值。然而对于BNNs,二值权重的幅值并无意义,因此不清楚这些超参数实际起何作用。一个例子是权重衰减,其旨在保持实值权重幅值较小。其他例子包括潜在权重初始化、学习率与学习率衰减,它们影响实值权重的幅值。幅值对实值权重可解释,但对二值权重失去意义。本文基于网络优化中的高阶梯度滤波,对这些基于幅值的超参数给出新的解释。我们的分析使得理解基于幅值的超参数如何影响二值网络训练成为可能,从而允许专为二值神经网络设计、独立于其实值解释的新优化滤波器。此外,我们改进的理解减少了超参数数量,进而减轻超参数调优负担,并可能带来更好的超参数值以提升精度。代码见 https://github.com/jorisquist/Understanding-WM-HP-in-BNNs

关键词

引用

@article{arxiv.2303.02452,
  title  = {Understanding weight-magnitude hyperparameters in training binary networks},
  author = {Joris Quist and Yunqiang Li and Jan van Gemert},
  journal= {arXiv preprint arXiv:2303.02452},
  year   = {2023}
}

备注

Conference: ICLR 2023