中文

BitStopper: 基于阶段融合与提前终止的高效 Transformer 注意力加速器

机器学习 2025-12-09 v1 信号处理

摘要

基于注意力的语言大模型(LLM)已改变现代 AI 应用,但自注意力的二次方代价带来了显著的计算与内存开销。动态稀疏(DS)注意力缓解了这一问题,但其硬件效率受到额外预测阶段及其带来的繁重内存访问的限制。为解决这些限制,本文提出 BitStopper,一种无需稀疏预测器的细粒度算法-架构协同设计。首先,提出位串行使能阶段融合(BESF)机制,通过逐步终止平凡 token 并将预测阶段合并到执行阶段来复用并最小化内存访问。其次,开发了一种轻量且自适应的 token 选择(LATS)策略,与位级稀疏推测协同工作。第三,采用位级异步处理(BAP)策略以提高按需位粒度内存获取期间的计算利用率。最后,设计了精巧的架构,将理论复杂度降低转化为实际性能提升。大量评估表明,与最先进的(SOTA)Transformer 加速器相比,BitStopper 相比 Sanger 和 SOFA 分别实现了 2.03 倍和 1.89 倍的速度提升,同时能效分别提升 2.4 倍和 2.1 倍。

关键词

引用

@article{arxiv.2512.06457,
  title  = {BitStopper: An Efficient Transformer Attention Accelerator via Stage-fusion and Early Termination},
  author = {Huizheng Wang and Hongbin Wang and Shaojun Wei and Yang Hu and Shouyi Yin},
  journal= {arXiv preprint arXiv:2512.06457},
  year   = {2025}
}