BinaryAttention:一种面向视觉和扩散Transformer的1位注意力
计算机视觉与模式识别
2026-03-11 v1
摘要
Transformer取得了广泛且卓越的成功,但其注意力模块的计算复杂度仍是视觉任务的主要瓶颈。现有方法主要采用8位或4位量化来平衡效率与精度。本文在理论依据下指出,注意力的二值化能够保留基本的相似关系,并提出BinaryAttention——一种高效且精准的1位qk注意力方法。具体而言,我们仅保留查询(query)和键(key)的符号,以位运算取代浮点点积,显著降低计算成本。通过引入可学习的偏置项,我们缓解了1位量化固有的性能损失,实现端到端加速。为维持注意力精度,我们采用量化感知训练和自蒸馏技术,缓解量化误差并确保符号对齐的相似性。BinaryAttention在A100 GPU上比FlashAttention2快2倍以上。广泛实验表明,BinaryAttention在视觉Transformer和扩散Transformer基准任务上可与或超越全精度注意力,验证了其有效性。本工作为低比特视觉和扩散Transformer提供了高效且高效的替代方案,推动了该领域的前沿发展。代码和模型可在https://github.com/EdwardChasel/BinaryAttention 查阅。
引用
@article{arxiv.2603.09582,
title = {BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers},
author = {Chaodong Xiao and Zhengqiang Zhang and Lei Zhang},
journal= {arXiv preprint arXiv:2603.09582},
year = {2026}
}
备注
Accepted by CVPR 2026