中文

BinaryViT:迈向高效且精确的二值视觉 Transformer

计算机视觉与模式识别 2023-09-06 v3

摘要

Vision Transformers (ViTs) 已成为大多数计算机视觉领域的基础架构,但可观的内存与计算成本阻碍其在资源受限设备上的应用。作为最强大的压缩方法之一,二值化通过将权重和激活值量化为 ±\pm1 来减少神经网络的计算。尽管现有二值化方法在卷积神经网络(CNNs)上已展现出优异性能,ViTs 的全二值化仍研究不足且遭受显著的性能下降。本文中,我们首先通过经验论证严重的性能退化主要由二值化训练中的权重振荡以及 ViTs 激活中的信息失真所致。基于这些分析,我们提出 BinaryViT\textbf{BinaryViT},一种精确的 ViTs 全二值化方案,将 ViTs 的量化推向极限。具体而言,我们提出一种新颖的梯度正则化方案(GRS)以驱动权重的双峰分布,从而减少二值化训练中的振荡。此外,我们设计了一个激活偏移模块(ASM)来自适应调节激活分布,以减少二值化引起的信息失真。在 ImageNet 数据集上的大量实验表明,我们的 BinaryViT 持续超越强基线 2.05%,并将全二值化 ViTs 的精度提升至可用水平。此外,与全精度 DeiT-S 相比,我们的方法在模型大小和 OPs 上分别实现了 16.2×\times 和 17.7×\times 的显著节省。

关键词

引用

@article{arxiv.2305.14730,
  title  = {BinaryViT: Towards Efficient and Accurate Binary Vision Transformers},
  author = {Junrui Xiao and Zhikai Li and Lianwei Yang and Qingyi Gu},
  journal= {arXiv preprint arXiv:2305.14730},
  year   = {2023}
}

备注

We will be making some significant changes to the paper, including the title and methodology. We therefore wish to withdraw the paper for now