中文

tuGEMM:面向低精度边缘AI的面积功耗高效时序单值GEMM架构

硬件体系结构 2024-12-25 v1 人工智能 机器学习

摘要

广义矩阵乘法(GEMM)是数据处理中普遍存在的计算内核/算法,广泛应用于人工智能(AI)和深度学习(DL)。近期向边缘计算的转变激发了基于单值计算的GEMM架构,这些架构主要是随机的且基于速率编码的系统。本文提出了一种基于时序编码的新型GEMM架构,称为tuGEMM,能够实现精确计算。我们引入了tuGEMM的两个变体,串行式和并行式,具有不同的面积/功耗-延迟权衡。报告了45 nm CMOS工艺下针对2位、4位和8位计算的后综合功耗-性能-面积(PPA)。该设计在低精度下相对于最先进的随机单值系统在面积功耗效率方面具有显著优势,例如仅需0.03 mm²和9 mW即可实现4位,0.01 mm²和4 mW即可实现2位。这使得tuGEMM适用于需要持续进行实时感知处理的功耗受限的移动和边缘设备。

关键词

引用

@article{arxiv.2412.17966,
  title  = {tuGEMM: Area-Power-Efficient Temporal Unary GEMM Architecture for Low-Precision Edge AI},
  author = {Harideep Nair and Prabhu Vellaisamy and Albert Chen and Joseph Finn and Anna Li and Manav Trivedi and John Paul Shen},
  journal= {arXiv preprint arXiv:2412.17966},
  year   = {2024}
}

备注

Published in 2023 IEEE International Symposium on Circuits and Systems (ISCAS), Monterey, CA, USA, 2023