ViT-1.58b:面向 1 位时代的移动视觉 Transformer
计算机视觉与模式识别
2024-06-27 v1
摘要
视觉 Transformer (ViT) 通过注意力机制将图像切块作为 token 处理,在 various 图像分类任务中取得了显著的性能。然而,ViT 的高计算和内存需求在资源受限的环境中构成了重大挑战。本文介绍 ViT-1.58b,一种新型 1.58 位量化 ViT 模型,旨在显著降低内存和计算开销,同时保持�争性能。ViT-1.58b 采用三值量化,通过将权重限制为 {-1, 0, 1} 且激活量化为 8 位精度来优化效率与精度之间的平衡。我们的方法确保内存和计算的高效扩展。在 CIFAR-10 和 ImageNet-1k 上的实验表明,ViT-1.58b 的准确率与全精度 ViT 相当,显著降低了内存使用和计算成本。本文凸显了极端量化技术在开发可持续 AI 解决方案方面的潜力,并为实际应用中高效模型部署的更广泛讨论做出了贡献。我们的代码和模型权重已发布于 https://github.com/DLYuanGod/ViT-1.58b。
引用
@article{arxiv.2406.18051,
title = {ViT-1.58b: Mobile Vision Transformers in the 1-bit Era},
author = {Zhengqing Yuan and Rong Zhou and Hongyi Wang and Lifang He and Yanfang Ye and Lichao Sun},
journal= {arXiv preprint arXiv:2406.18051},
year = {2024}
}