TransDot:面向 FPGA AI 引擎的面积高效可重构浮点点单元用于超精度点积积累
硬件体系结构
2026-05-11 v1
摘要
商业 FPGA 如 AMD Versal 设备越来越多地集成 AI 引擎,利用低精度压缩 SIMD fused multiply-accumulate(FMA)来实现比例吞吐量提升。然而,超精度 FMA(例如,将两个 FP16 数相乘后与 FP32 累加器相加)仍受制于最高精度、最低吞吐量的操作。点积积累(DPA)(例如,对两个 4 元素 FP8 向量执行点积并将其结果与 FP32 累加器相加)可完全利用输入/输出带宽和计算资源。现有的灵活开源 FPUs 如 FPnew 不支持 DPA,并通过复制独立 FMA 信道来在低精度格式上实现 SIMD FMA,这增加了面积、 underutilizes 共享算术资源,并使 DPA 操作的集成复杂化。本文提出了 TransDot,一种在共享、可重构数据通路中统一多精度 SIMD FMA 和超精度 DPA 的可重构 FPU。TransDot 通过可重构子组件扩展基线设计,对 2 项 FP16、4 项 FP8 和 8 项 FP4 点积积累到 FP32 实现。评估显示,TransDot 通过 DPA 以 FP32 累加实现 2 倍 FP16、4 倍 FP8 和 8 倍 FP4 吞吐量,FP16 DPA 的面积效率提升 1.46 倍,FP8 DPA 的面积效率提升 2.92 倍,平均面积增加 37.3%,点积模式下的额外流水线阶段相对于 FPnew 基线。这些结果表明,TransDot 的面积高效设计使其可在下一代 AMD Versal AI 引擎中可扩展部署。
引用
@article{arxiv.2605.07245,
title = {TransDot: An Area-efficient Reconfigurable Floating-Point Unit for Trans-Precision Dot-Product Accumulation for FPGA AI Engines},
author = {Jiayi Wang and Maohua Nie and Sin-Chen Lin and C. -J. Richard Shi and Ang Li},
journal= {arXiv preprint arXiv:2605.07245},
year = {2026}
}
备注
To appear in FCCM 2026