MX:增强 RISC-V 向量指令集以实现超低开销、高能效矩阵乘法
硬件体系结构
2024-01-09 v1
摘要
稠密矩阵乘法(MatMul)可以说是最普遍的计算密集型核心之一,涵盖线性代数、数字信号处理(DSP)、图形学和机器学习应用。因此,MatMul 优化不仅在高性能处理器中至关重要,在嵌入式低功耗平台中亦是如此。近期,一些指令集架构(ISA)已纳入矩阵扩展,以提升 MatMul 性能和效率,但代价是增加了矩阵寄存器堆和单元。本文提出矩阵扩展(MX),这是一种轻量级方法,基于开源 RISC-V 向量(RVV)指令集架构来提升 MatMul 能效。MX 并未增加昂贵的专用硬件,而是利用已有的向量寄存器堆和功能单元创建了一个混合向量/矩阵引擎,面积成本可忽略不计(< 3%),这源于一个用于提高数据复用的紧凑近浮点单元(FPU)瓦片缓冲器,且无时钟频率开销。我们在一个紧凑且高度能效优化的 RVV 处理器上实现了 MX,并在 12 纳米技术节点的双核和 64 核集群中对其进行了评估。在双精度 64x64x64 矩阵乘法中,MX 在相同 FPU 利用率(~97%)下将双核能效提升了 10%;在 64 核集群上对 32 位数据的相同基准测试中,能效提升了 25%,性能提升了 56%。
引用
@article{arxiv.2401.04012,
title = {MX: Enhancing RISC-V's Vector ISA for Ultra-Low Overhead, Energy-Efficient Matrix Multiplication},
author = {Matteo Perotti and Yichao Zhang and Matheus Cavalcante and Enis Mustafa and Luca Benini},
journal= {arXiv preprint arXiv:2401.04012},
year = {2024}
}