TriGen:基于软件-硬件协设计的面向大语言模型的 NPU 架构
硬件体系结构
2026-02-16 v1 人工智能
摘要
近年来,广泛探索了用于加速 AI 推理的 NPU 架构,这些架构本质上受资源受限环境的制约。与此同时,基于 transformer 的大语言模型(LLM)已成为主导,模型规模快速增长但参数复用程度较低,相较于传统 CNN,这使得在资源受限设备上实现端到端执行极具挑战性。为此,我们提出一种面向资源受限环境的新型 NPU 架构 TriGen,通过软件-硬件协设计实现。首先,TriGen 采用低精度计算使用微标量放大(MX)以实现额外的优化机会,同时保持准确性,并解决因采用此类精度而产生的问题。其次,为联合优化非线性和线性操作,TriGen 通过使用快速且准确的查找表(LUT)消除对必需非线性操作专用硬件的需求,从而最大化性能收益并减少面向设备环境的硬件成本。最后,考虑到实际硬件约束,进一步采用调度技术,即使在有限的片上内存容量下,也能最大化计算利用率。我们在各种 LLM 上评估了 TriGen 的性能,显示 TriGen 在基线 NPU 设计上实现平均 2.73 倍的性能加速和 52% 的内存传输减少,同时几乎不损失准确性。
引用
@article{arxiv.2602.12962,
title = {TriGen: NPU Architecture for End-to-End Acceleration of Large Language Models based on SW-HW Co-Design},
author = {Jonghun Lee and Junghoon Lee and Hyeonjin Kim and Seoho Jeon and Jisup Yoon and Hyunbin Park and Meejeong Park and Heonjae Ha},
journal= {arXiv preprint arXiv:2602.12962},
year = {2026}
}
备注
13 pages, 14 figures