面向高效长上下文 LLM 推理的混合键合架构与混合稀疏注意力
性能
2025-12-09 v2
摘要
大型语言模型(LLMs)在广泛的自然语言处理应用中展现了卓越的能力。然而,KV 缓存带来的高能耗和延迟开销限制了其在边缘设备上的部署,尤其是针对长上下文场景。新兴的混合键合(Hybrid Bonding, HB)技术被提出作为传统近内存处理(NMP)架构的有前景的替代方案,提供更高的带宽效率和更低的功耗,同时具有分布式内存特征。本文提出H2EAL,一种基于混合键合的加速器,结合稀疏注意力算法与硬件协同设计,实现边缘端高效的LLM推理。在算法层面,我们提出一种针对不同注意力头的静态与动态稀疏注意力方案,以实现高精度下的稀疏化充分利用。在硬件层面,我们协同设计硬件以支持混合稀疏注意力,提出内存-计算共置策略以解决分布式内存瓶颈。由于不同注意力头呈现不同的稀疏模式且注意力结构常与HB架构不匹配,我们进一步开发了基于平行瓶片注意力的负载均衡调度器,以解决工作负载不均衡并优化映射策略。大量实验表明,H2EAL在多个基准上相较于基线HB实现实现了5.20~48.21倍的加速和6.22~73.48倍的能效提升,平均准确率下降仅为0.87%。
引用
@article{arxiv.2508.16653,
title = {H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference},
author = {Zizhuo Fu and Xiaotian Guo and Wenxuan Zeng and Shuzhang Zhong and Yadong Zhang and Peiyu Chen and Runsheng Wang and Le Ye and Meng Li},
journal= {arXiv preprint arXiv:2508.16653},
year = {2025}
}
备注
International Conference on Computer-Aided Design (ICCAD) 2025