MXDOTP:一种面向微标量(MX)浮点点积的 RISC-V ISA 扩展
硬件体系结构
2025-05-20 v1
摘要
快速且高效的低位宽浮点(FP)算术是人工智能(AI)系统的关键需求。微标量(MX)标准化格式最近作为基准低位宽 FP 格式的有前景的替代方案,提供了以块状共享指数尺度结合每个元素值改进精度的优势。然而,高效执行 AI 应用的关键线性代数原始操作(如 scaled dot product)在 MX 格式上需要专门的硬件支持以实现基本算子。本文提出 MXDOTP,即首个针对 MX 点积的 RISC-V ISA 扩展,聚焦于 8 位 MXFP8 格式。我们将 MXFP8 点积-累加单元集成到开源的 Snitch RISC-V 核心中,该单元完整消耗八个 8 位操作数打包到 64 位输入的块。为实现每周期四个操作数(包括块尺度)的满负载利用,我们利用 Snitch 的流语义寄存器(SSRs),实现最高 80% 的利用率,对 Snitch 核心体系结构影响最小且无需修改寄存器文件。 implemented in 12 nm FinFET,一个包含八个 MXDOTP 扩展核心的集群在 0.8 V、1 GHz 条件下计算 MXFP8 矩阵乘法可达最高 356 GFLOPS/W。与软件基准(即通过类型转换将 FP8 输入转换为 FP32 以获得更高的累积精度并应用显式块缩放)相比,该集群实现了 25 倍加速和 12.5 倍能效提升,仅增加 5.1% 的面积。
引用
@article{arxiv.2505.13159,
title = {MXDOTP: A RISC-V ISA Extension for Enabling Microscaling (MX) Floating-Point Dot Products},
author = {Gamze İslamoğlu and Luca Bertaccini and Arpan Suravi Prasad and Francesco Conti and Angelo Garofalo and Luca Benini},
journal= {arXiv preprint arXiv:2505.13159},
year = {2025}
}
备注
Accepted at the 36th IEEE International Conference on Application-specific Systems, Architectures and Processors (ASAP 2025)