中文

面向 AI/ML 应用的片上可训练可扩展 ANN 的存内实现

信号处理 2020-05-20 v1 硬件体系结构 机器学习 神经与进化计算

摘要

传统的基于冯·诺依曼架构的处理器由于包含分离的运算与存储单元(即所谓内存墙),在能耗和吞吐率方面变得低效。当人工神经网络(ANN)的实时实现需要在运算与存储单元之间进行大规模并行和频繁数据搬移以支撑众多智能应用时,内存墙问题进一步加剧。解决内存墙问题最有前景的方法之一是在存储核心内部进行计算,从而提升大规模计算的存储带宽与能耗效率。本文提出一种用于人工智能(AI)和机器学习(ML)应用的 ANN 存内计算架构。该架构利用基于标准六晶体管(6T)静态随机存取存储器(SRAM)核心的深度存内架构实现多层感知机。我们新颖的片上训练与推理存内架构通过每个预充电周期同时访问 SRAM 阵列的多行并消除频繁的数据访问,降低了能耗并提升了吞吐率。所提架构实现了反向传播——这是网络训练的关键,使用了新提出的若干构建模块,如权重更新、模拟乘法、误差计算、有符号模数转换以及其他必要的信号控制单元。该架构在 IRIS 数据集上训练与测试,相较于早期分类器,每次 MAC(乘加)操作能耗效率约提升 46 倍。

关键词

引用

@article{arxiv.2005.09526,
  title  = {In-memory Implementation of On-chip Trainable and Scalable ANN for AI/ML Applications},
  author = {Abhash Kumar and Jawar Singh and Sai Manohar Beeraka and Bharat Gupta},
  journal= {arXiv preprint arXiv:2005.09526},
  year   = {2020}
}