中文

Axon:面向改进运行时和能源效率的新型脉动阵列架构集成 on-chip im2col

硬件体系结构 2025-01-13 v1

摘要

矩阵乘法(GeMM)是几乎所有人工智能应用的核心操作。基于脉动阵列(SA)的架构因其速度和能源效率显示出巨大的前景。然而,SA由于通过流水线锁存器的单向传播, incurs 载 operand 填充时的线性延迟。本文提出了一种在 SA 中实现 novel 数据编排技术的方式,通过在主对角线上启用数据输入并实现双向传播。此举可在最小硬件开销下将运行时间提高最高可达 2 倍。此外,所提出的数据编排技术通过简单硬件支持实现卷积降低(即 im2col),充分利用输入特征图的复用机会,显著降低外部存储器的流量,在 YOLOv3 和 RESNET50 工作负载平均情况下实现 1.2 倍吞吐量提升和 2.17 倍推理能耗降低。与传统数据编排不同,若要在硬件中实现 im2col 需要更复杂的硬件和控制信号,因为数据倾斜问题。我们使用 ASAP 7nm PDK 对 16x16 脉动阵列进行了综合和布线,结果表明我们提出的方法在面积和功耗上分别仅增加 0.211% 和 1.6% 的开销。

关键词

引用

@article{arxiv.2501.06043,
  title  = {Axon: A novel systolic array architecture for improved run time and energy efficient GeMM and Conv operation with on-chip im2col},
  author = {Md Mizanur Rahaman Nayan and Ritik Raj and Gouse Basha Shaik and Tushar Krishna and Azad J Naeemi},
  journal= {arXiv preprint arXiv:2501.06043},
  year   = {2025}
}

备注

Accepted for Design Automation and Test in Europe (DATE), 2025. This is preprint of the accepted version