中文

使用 STE 变体训练量化神经网络:加性噪声退火算法

机器学习 2022-03-23 v1 计算机视觉与模式识别

摘要

训练量化神经网络(QNNs)是一个不可微优化问题,因为权重和特征由分段常数函数输出。标准解决方案是应用直通估计器(STE),在推理和梯度计算步骤中使用不同的函数。文献中已提出若干 STE 变体,旨在最大化训练网络的任务精度。本文中,我们分析 STE 变体并研究它们对 QNN 训练的影响。我们首先观察到大多数此类变体可建模为阶梯函数的随机正则化;尽管这一直观解释并不新颖,我们严格的讨论推广到了进一步的变体。然后,我们分析混合不同正则化的 QNN,发现需要每层映射的某种适当同步平滑,以保证逐点复合收敛到目标不连续函数。基于这些理论见解,我们提出加性噪声退火(ANA),一种训练 QNN 的新算法,将标准 STE 及其变体作为特例涵盖。在 CIFAR-10 图像分类基准上测试 ANA 时,我们发现对任务精度的主要影响并非来自正则化的定性形状,而是来自网络中使用的不同 STE 变体的适当同步,这与理论结果一致。

关键词

引用

@article{arxiv.2203.11323,
  title  = {Training Quantised Neural Networks with STE Variants: the Additive Noise Annealing Algorithm},
  author = {Matteo Spallanzani and Gian Paolo Leonardi and Luca Benini},
  journal= {arXiv preprint arXiv:2203.11323},
  year   = {2022}
}