中文

新型CMOS高度并行、低功耗、多芯片神经网络加速器的协同设计

分布式、并行与集群计算 2024-10-01 v1 人工智能 硬件体系结构

摘要

为什么安防摄像头、传感器和Siri使用云服务器而不是板载计算?缺乏极低功耗、高性能的芯片极大地限制了部署无束缚边缘设备的能力。我们提出了NV-1,一种新型低功耗ASIC AI处理器,通过大量并行的组合处理器-内存单元(即一种彻底的非冯·诺依曼架构),极大地加速了并行处理(>10倍),同时显著降低了能耗(>100倍),从而避免了典型单片存储器带来的瓶颈。当前初始原型芯片的成功流片源于算法和软件驱动的架构设计与VLSI设计现实之间的协同开发努力。一种创新的通信协议最大限度地降低了功耗,并且通过消除地址总线(通过本地目标地址匹配),节点间的数据传输成本大大降低。在整个开发过程中,软件和架构团队能够与电路设计团队的实施工作同步创新。在早期就开发了所提议硬件的数字孪生,以确保技术实现满足架构规范,并且预测的性能指标现在已通过真实硬件测试数据得到彻底验证。由此产生的器件目前正用于已部署的边缘传感器应用;额外的原理验证正在进行中,以展示这款新型现实世界超低功耗高性能ASIC器件的实际效果。

关键词

引用

@article{arxiv.2409.19389,
  title  = {Co-design of a novel CMOS highly parallel, low-power, multi-chip neural network accelerator},
  author = {W Hokenmaier and R Jurasek and E Bowen and R Granger and D Odom},
  journal= {arXiv preprint arXiv:2409.19389},
  year   = {2024}
}

备注

neural network accelerator, low-power design, instruction set design, parallel processors, digital twin