正则化激活分布以训练二值化深度网络
计算机视觉与模式识别
2019-04-08 v1
摘要
二值化神经网络(BNNs)因其纯逻辑计算与更少的内存访问,可显著降低资源受限设备上的推理延迟与能耗。然而,训练 BNNs 十分困难,因为激活流会遇到退化、饱和与梯度失配问题。先前工作通过增加激活位数并添加浮点缩放因子来缓解这些问题,从而牺牲了 BNN 的能效。本文中,我们提出使用分布损失来显式正则化激活流,并开发了系统表述该损失的框架。我们的实验表明,分布损失能在不损失能效收益的前提下持续提升 BNNs 的精度。此外,辅以所提正则化,BNN 训练对包括优化器与学习率在内的超参数选择表现出鲁棒性。
引用
@article{arxiv.1904.02823,
title = {Regularizing Activation Distribution for Training Binarized Deep Networks},
author = {Ruizhou Ding and Ting-Wu Chin and Zeye Liu and Diana Marculescu},
journal= {arXiv preprint arXiv:1904.02823},
year = {2019}
}