中文

ESACT:基于局部相似性的面向计算密集型Transformer的端到端稀疏加速器

机器学习 2025-12-05 v2 硬件体系结构

摘要

Transformer由QKV生成、注意力计算和FFN组成,因其卓越性能已成为各领域的主导模型。然而,其高计算成本阻碍了高效硬件部署。稀疏性提供了有前景的解决方案,但大多数现有加速器仅利用注意力中的行内稀疏性,少数方法则考虑行间稀疏性。依赖全局相似性估计的做法会降低稀疏性加速的收益,通常仅将稀疏性应用于一个或两个Transformer组件。通过对注意力分布和计算流程的深入分析,我们观察到局部相似性允许以较低计算开销实现端到端稀疏加速。基于此观察,我们提出ESACT,一个面向计算密集型Transformer的端到端稀疏加速器。ESACT核心是基于局部相似性的稀疏性预测(Sparsity Prediction with Local Similarity, SPLS)机制,利用HLog量化在QKV生成前准确预测局部注意力稀疏性,实现所有Transformer组件的高效稀疏化。为支持高效硬件实现,我们引入了三个架构创新。实验结果表明,SPLS将总计算量降低52.03%,且准确率损失不足1%。ESACT实现了3.29 TOPS/W的端到端能效,相较于SOTA注意力加速器SpAtten和Sanger分别在注意力级能效提升2.95倍和2.26倍。

关键词

引用

@article{arxiv.2512.02403,
  title  = {ESACT: An End-to-End Sparse Accelerator for Compute-Intensive Transformers via Local Similarity},
  author = {Hongxiang Liu and Zhifang Deng and Tong Pu and Shengli Lu},
  journal= {arXiv preprint arXiv:2512.02403},
  year   = {2025}
}