击中平衡:跨代 Ryzen AI NPU 的 GEMM 性能优化
硬件体系结构
2025-12-16 v1
摘要
现代深度学习 (DL) 工作负载的高计算和内存需求,导致从云端到边缘设备开发专用硬件设备,例如 AMD 的 Ryzen AI XDNA NPU。针对这些架构优化通用矩阵乘法 (GEMM) 算法对于提高 DL 工作负载性能至关重要。为此,本文提出了一种系统化的方法,用于优化当前两种 NPU 代数的 GEMM 工作负载,即 XDNA 和 XDNA2。我们的实现利用 AMD NPU 的独特架构特征,解决系统层面的关键性能瓶颈。跨各种 GEMM 规模的端到端性能评估显示,针对 8 位整数 (int8) 精度,最高可达最高达 6.76 TOPS (XDNA) 和 38.05 TOPS (XDNA2);针对脑浮点 (bf16) 精度,我们的 GEMM 实现最高可达 3.14 TOPS (XDNA) 和 14.71 TOPS (XDNA2)。本工作为优化 Ryzen AI NPU 上的 GEMM 工作负载提供了重要的性能见解。
引用
@article{arxiv.2512.13282,
title = {Striking the Balance: GEMM Performance Optimization Across Generations of Ryzen AI NPUs},
author = {Endri Taka and Andre Roesti and Joseph Melber and Pranathi Vasireddy and Kristof Denolf and Diana Marculescu},
journal= {arXiv preprint arXiv:2512.13282},
year = {2025}
}