中文

QFlash:视觉 Transformer 注意力中量化与内存效率的桥接

机器学习 2026-04-29 v1 人工智能

摘要

FlashAttention 通过分块实现效率提升,但其在线 softmax 仍依赖浮点运算以获得数值稳定性,使得完全量化困难。我们确定阻碍整数-only FlashAttention 的三个主要障碍:(1)块状累加期间的尺度爆炸,(2)GPU 上低效的基于平移的指数运算,(3)需要统一尺度的量化粒度约束进行整数比较。为解决这些挑战,我们提出 QFlash,一种端到端整数 FlashAttention 设计,完整在整数域中执行 softmax 操作,并作为单个 Triton kernel 实现。我们在来自 ViT、DeiT 和 Swin 模型的七个注意力工作负载上进行测试,QFlash 对 I-ViT achieves 最高 6.73×\times 的加速,对 Swin 最高达到 8.69×\times,同时在不牺牲 ViT/DeiT Top-1 准确率的情况下,将能源消耗比 FP16 FlashAttention 降低 18.8\%,在每个张量量化下对 Swin 仍保持竞争力。我们的代码已公开于 https://github.com/EfficientCompLab/qflash。

关键词

引用

@article{arxiv.2604.25306,
  title  = {QFlash: Bridging Quantization and Memory Efficiency in Vision Transformer Attention},
  author = {Sehyeon Oh and Yongin Kwon and Jemin Lee},
  journal= {arXiv preprint arXiv:2604.25306},
  year   = {2026}
}

备注

11 pages, 6 figures