中文

Ten-Four:面向混合精度 GPGPU 张量核心的开源融合点积单元

硬件体系结构 2026-04-07 v2

摘要

高效的混合精度矩阵乘累加(MMA)操作对加速 GPGPU 上的深度学习工作负载至关重要。然而,现有的开源点积实现依赖离散算术单元,导致高延迟、累积性舍入误差和资源利用不足。为解决这些挑战,我们提出了Ten-Four—a款可扩展的混合精度融合点积单元,将浮点运算和整数运算管道集成于单个融合架构中,实现于开源基于 RISC-V 的 Vortex GPGPU 的张量核心单元扩展中。该设计支持FP16/BF16/FP8/BF8/INT8/INT4格式的低精度乘法和FP32/INT32的高精度累加,原生支持微标量(MX)和稀疏 lane 时钟门控,以实现动态功耗降低,同时匹配NVIDIA 张量核心的数值精度。Ten-Four在262.325 MHz Fmax下实现4周期操作延迟,提供134.308 GFLOPS峰值吞吐量(每个张量核心),在AMD Xilinx Alveo U55C FPGA上实现,相较于等效的Berkeley HardFloat实现,性能提升约3.1倍,同时面积成本不足60%。

关键词

引用

@article{arxiv.2512.00053,
  title  = {Ten-Four: An Open-Source Fused Dot Product Unit for Mixed-Precision GPGPU Tensor Cores},
  author = {Nikhil Rout and Blaise Tine},
  journal= {arXiv preprint arXiv:2512.00053},
  year   = {2026}
}

备注

8 pages, 6 figures, 3 tables