中文

PADE:基于统一执行与阶段融合的无预测器稀疏注意力加速器

硬件体系结构 2026-01-13 v2 信号处理

摘要

注意力模型已彻底革新了人工智能,但自注意力的二次计算成本在计算和内存开销方面构成了严峻挑战。稀疏注意力方法通过跳过低相关性 token 对来缓解这一问题。然而,当前方法因额外稀疏预测器的高额开销而缺乏实用性,严重降低硬件效率。本文通过提出位串联启用阶段融合(BSF)机制,消除独立预测器的需求,推动了最新进展。然而,其面临关键挑战:1)位分片稀疏预测导致误判;2)因粒度细小且不均衡的位级工作量导致硬件资源 underutilization;3)因稀疏修剪准则的行级依赖导致平铺困难。我们提出 PADE,一种用于动态稀疏注意力加速的无预测器算法-硬件协同设计。PADE 具有三个关键创新:1)基于位不确定性区间的启用过滤(BUI-GF)策略,以准确识别每个位轮次中的平凡 token;2)双向稀疏基准的无序执行(BS-OOE)以提高硬件利用率;3)基于交错的稀疏分块注意(ISTA)以降低 I/O 和计算复杂度。这些技术结合定制加速器设计,使稀疏注意力加速在无需额外稀疏预测器的情况下实现了实际可行性。在 22 个基准测试上,PADE 比 Nvidia H100 GPU 实现了 7.43 倍加速和 31.1 倍能效提升。相较于最新加速器,PADE 对 Sanger、DOTA 和 SOFA 分别实现了 5.1 倍、4.3 倍和 3.4 倍的能耗节省。

关键词

引用

@article{arxiv.2512.14322,
  title  = {PADE: A Predictor-Free Sparse Attention Accelerator via Unified Execution and Stage Fusion},
  author = {Huizheng Wang and Hongbin Wang and Zichuan Wang and Zhiheng Yue and Yang Wang and Chao Li and Yang Hu and Shouyi Yin},
  journal= {arXiv preprint arXiv:2512.14322},
  year   = {2026}
}

备注

Accepted by HPCA 2026. A more formal version