中文

BWTA:基于算法-硬件协同设计的高精度高效二值化 Transformer

机器学习 2026-04-07 v1 计算与语言

摘要

超低位量化为 Transformer 模型带来了显著的效率提升,但精度下降和有限的 GPU 支持阻碍了其广泛应用。本文分析二值化中的零点失真,提出 Binary Weights & Ternary Activations (BWTA) 量化方案,将极小值投影到零,从而保持极低位模型的精度。在训练阶段,本文提出 Smooth Multi-Stage Quantization 方案,结合层级性损耗策略和幅度对齐投影因子,以实现稳定且快速的收敛。在推理阶段,开发 BWTA MatMul CUDA 核函数,实现指令级并行位打包和全面的二值化/三值化 MatMul 实现,适用于线性和注意力算子,实现在 Transformer 架构中的无缝集成。实验表明,BWTA 在 BERT 上可达到全精度性能,GLUE 上平均下降 3.5%,五个任务上下降不足 2%,对 LLM 的 perplexity 和准确率也表现出色。在效率方面,相较于 FP16 在 NVIDIA GPU 上实现 16 至 24 倍的内核级加速,在 LLM 上实现 216 至 330 tokens/s 的端到端 prefill 加速,并拥有更小的内存占用。作为一种算法-硬件协同设计,BWTA 在不牺牲模型质量的前提下,展示了实用且低延迟的超低位推理能力。

关键词

引用

@article{arxiv.2604.03957,
  title  = {BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design},
  author = {Yifu Ding and Xianglong Liu and Shenghao Jin and Jinyang Guo and Jiwen Lu},
  journal= {arXiv preprint arXiv:2604.03957},
  year   = {2026}
}

备注

Under review