Tempus:面向 Versal AI Edge 的时序可扩展资源无关 GEMM 流式框架
分布式、并行与集群计算
2026-05-05 v2 硬件体系结构
机器学习
性能
机器人学
摘要
大型语言模型(LLM)的尺度律规定,模型质量随计算规模的提升,但边缘部署则对计算、内存和功耗施加了严格限制。由于常规矩阵乘法(GEMM)占推理时间的高达 90%,高效的 GEMM 加速对边缘 AI至关重要。虽然 AMD Versal 自适应 SoC 可用的自适应智能引擎非常适合此任务,但现有最先进(SOTA)框架通过在数百个核心上分布工作负载来最大化性能——这种方法在资源受限的边缘 SoC 上会因物理实现故障、带宽饱和和资源消耗过度而失败。我们提出了 Tempus,一种面向 AMD Versal AI Edge SoC 的资源无关时序 GEMM 框架。Tempus 采用固定的 16 个 AIE-ML 核心,通过迭代图执行和算法数据在可编程逻辑中的分块和复制来实现可扩展性。高速级联流式传输确保在初始间隔(II)为 1 时实现低延迟的部分求和归约,而无死锁的数据流协议最大化了传输-计算重叠和 PLIO 重用。在 GEMM 工作负载上评估后,Tempus 在 10.677 W 总功耗下实现了 607 GOPS。通过通过平台感知效用(PAU)指标刻画系统水平效率,我们证明 Tempus 比领先的空间 SOTA(ARIES) Achieved 211.2 倍的显著性因子。此外,框架保持 0.00% 的 URAM/DSP 利用率,实现了 22.0 倍的核心节俗、7.1 倍的功率节俗和 6.3 倍的 I/O 需求降低,为边缘 LLM 推理建立了一个可持续、可扩展的基础。
引用
@article{arxiv.2605.00536,
title = {Tempus: A Temporally Scalable Resource-Invariant GEMM Streaming Framework for Versal AI Edge},
author = {M. Grailoo and J. Núñez-Yáñez},
journal= {arXiv preprint arXiv:2605.00536},
year = {2026}
}
备注
Source code available at: https://github.com/mgrailoo/TEMPUS