中文

层级式渐进冻结实现深度二进制神经网络的无梯度逐层训练

机器学习 2026-02-02 v1

摘要

我们研究了渐进冻结作为训练二进制网络时直通估计器(STE)的替代方案。在受控的训练条件下,我们发现全局渐进冻结对二进制权重网络有效,但由于激活引起的梯度阻塞,无法应用于完整的二进制神经网络。我们引入StoMPP(Stochastic Masked Partial Progressive Binarization),其采用层级随机掩码逐步替换可微分裁剪权重/激活为硬二进制阶跃函数,仅通过未冻结部分(即不使用直通估计器)进行反向传播。在匹配的最小化训练配方下,StoMPP在BinaryConnect风格的STE基线上取得更高的准确率,提升幅度随网络深度增加(例如对于ResNet-50 BNN:在CIFAR-10上提升18.0,在CIFAR-100上提升13.5,在ImageNet上提升3.8;对于ResNet-18:分别提升3.1、4.7和1.3)。对于二进制权重网络,StoMPP在CIFAR-10上实现91.2%的准确率,在CIFAR-100上实现69.5%的准确率。我们分析了在渐进冻结下的训练动力学,揭示了非单调收敛现象以及在二进制化约束下的深度扩展性能提升。

关键词

引用

@article{arxiv.2601.22660,
  title  = {Layerwise Progressive Freezing Enables STE-Free Training of Deep Binary Neural Networks},
  author = {Evan Gibson Smith and Bashima Islam},
  journal= {arXiv preprint arXiv:2601.22660},
  year   = {2026}
}