面向卷积神经网络的三角输入移动 Systolic Array:数据流与分析建模
人工智能
2025-08-01 v3 硬件体系结构
摘要
为跟随最新 AI 模型日益增长的计算复杂度和数据强度,需要提出新的计算范式。这些范式旨在通过减轻与处理器核心与内存之间数据传输相关的能耗瓶颈(von Neumann 瓶颈),实现更高的能源效率。卷积神经网络(CNNs)因需管理海量数据而受此瓶颈影响。Systolic Array(SA)因其处理元素(PE)的高数据利用率而成为缓解数据传输成本的有前景架构。这些 PE 基于特定数据流(如权重固定和行固定)持续交换和处理数据,从而降低对主存的访问次数。在 SA 中,卷积要么作为矩阵乘法实现,要么利用滑动窗口的光栅顺序扫描。然而,数据冗余是影响面积、功耗和能耗的主要问题。本文提出 TrIM:一种基于三角输入移动的数据流,兼容 CNN 计算。TrIM 最大化本地输入利用率,最小化权重数据传输,解决数据冗余问题。此外,TrIM 不会引入行固定数据流所需的显著片上内存惩罚。与当前 SA 数据流相比,TrIM 提供的高数据利用率保证约仅需访问主存的 10 倍。此外,考虑到 PE 持续重叠乘法和累加,TrIM 实现了高吞吐量(比行固定高达 81.8%),且所需寄存器数量有限(比行固定少至 15.6 倍)。
关键词
引用
@article{arxiv.2408.01254,
title = {TrIM, Triangular Input Movement Systolic Array for Convolutional Neural Networks: Dataflow and Analytical Modelling},
author = {Cristian Sestito and Shady Agwa and Themis Prodromakis},
journal= {arXiv preprint arXiv:2408.01254},
year = {2025}
}
备注
This work has been accepted by IEEE TCASAI for publication