中文

通过动态阈值学习提升二值神经网络

图像与视频处理 2022-11-11 v1 计算机视觉与模式识别

摘要

开发轻量化的深度卷积神经网络(DCNNs)与视觉 Transformer(ViTs)已成为视觉研究的焦点之一,因为低计算成本对于在边缘设备上部署视觉模型至关重要。近来,研究者通过二值化全精度神经网络的权重与激活,探索了高计算效率的二值神经网络(BNNs)。然而,二值化过程导致 BNN 与其全精度版本之间存在巨大的精度差距。主要原因之一是带预定义或学习的静态阈值的符号函数限制了二值化架构的表示能力,因为单阈值二值化无法利用激活分布。为克服该问题,我们将通道信息的统计量引入符号函数的显式阈值学习,称为 DySign,以基于输入分布生成多样化阈值。我们的 DySign 是一种减少信息损失并提升 BNN 表示能力的直接方法,可灵活应用于 DCNNs 与 ViTs(即 DyBCNN 与 DyBinaryCCT)以实现显著的性能提升。如我们广泛的实验所示:对于 DCNNs,基于两种骨干网络(MobileNetV1 与 ResNet18)的 DyBCNN 在 ImageNet 数据集上分别达到 71.2% 与 67.4% 的 top1 准确率,大幅超越基线(即分别提升 1.8% 与 1.5%);对于 ViTs,DyBinaryCCT 展现了全二值化 ViTs 中卷积嵌入层的优越性,在 ImageNet 数据集上达到 56.1%,较基线高出近 9%。

关键词

引用

@article{arxiv.2211.02292,
  title  = {Boosting Binary Neural Networks via Dynamic Thresholds Learning},
  author = {Jiehua Zhang and Xueyang Zhang and Zhuo Su and Zitong Yu and Yanghe Feng and Xin Lu and Matti Pietikäinen and Li Liu},
  journal= {arXiv preprint arXiv:2211.02292},
  year   = {2022}
}