估计器遇见均衡视角:一种用于二值神经网络训练的修正直通估计器
计算机视觉与模式识别
2023-08-28 v2
摘要
神经网络二值化是神经网络压缩中的主导范式。开创性工作 BinaryConnect 使用直通估计器 (STE) 来模拟符号函数的梯度,但也引发了关键的不一致问题。以往多数方法设计不同于 STE 的估计器以缓解该问题,却忽视了在减小估计误差的同时梯度稳定性会随之降低这一事实。这些高度发散的梯度会损害模型训练,并增加梯度消失与梯度爆炸的风险。为充分考量梯度稳定性,我们提出一种看待二值神经网络 (BNN) 训练的新视角,将其视为估计误差与梯度稳定性之间的均衡。在此视角下,我们首先设计两个指标定量展示该均衡现象。此外,为良好平衡估计误差与梯度稳定性,我们修正原始直通估计器,提出一种基于幂函数的估计器——修正直通估计器 (简称 ReSTE)。相较于其他估计器,ReSTE 合理且能够灵活平衡估计误差与梯度稳定性。在 CIFAR-10 与 ImageNet 数据集上的大量实验表明,ReSTE 性能优异,且无需任何辅助模块或损失即超越当前最优方法。
引用
@article{arxiv.2308.06689,
title = {Estimator Meets Equilibrium Perspective: A Rectified Straight Through Estimator for Binary Neural Networks Training},
author = {Xiao-Ming Wu and Dian Zheng and Zuhao Liu and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2308.06689},
year = {2023}
}
备注
10 pages, 6 figures. Accepted in ICCV 2023