中文

PAROAttention:面向视觉生成模型的模式感知重排序以实现稀疏量化注意力

计算机视觉与模式识别 2025-06-23 v1 图形学

摘要

在视觉生成任务中,注意力机制的二次复杂度导致高内存和计算成本,尤其是对于高分辨率图像或多帧视频生成所需的较长 token 序列而言更为如此。为此,已有研究探索了稀疏化和量化等技术。然而,这些技术在稀疏度较低和位宽缩减的情况下面临显著挑战。通过系统化分析,我们识别出核心难点源于视觉注意力模式的分散和不规则特征。因此,我们提出一种替代策略:*重新组织*注意力模式以缓解这些挑战。灵感来自视觉特征提取中局部聚合的本质,我们设计一种新的**模式感知 token 重排序(PARO)**技术,将多样化的注意力模式统一为一种硬件友好的块状模式。这种统一显著简化并提升了稀疏化和量化。我们评估了各种设计选择的性能与效率权衡,并最终确定量身为该统一模式所定制的方法。我们的**PAROAttention**方法在几乎保持无损指标的同时,实现了与全精度(FP)基线几乎相同的效果,但以显著更低的稀疏度(约 20%-30%)和位宽(**INT8/INT4**)运行,实现了 **1.9 倍至 2.7 倍** 的端到端延迟加速。

关键词

引用

@article{arxiv.2506.16054,
  title  = {PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models},
  author = {Tianchen Zhao and Ke Hong and Xinhao Yang and Xuefeng Xiao and Huixia Li and Feng Ling and Ruiqi Xie and Siqi Chen and Hongyu Zhu and Yichong Zhang and Yu Wang},
  journal= {arXiv preprint arXiv:2506.16054},
  year   = {2025}
}

备注

project page: https://a-suozhang.xyz/paroattn.github.io