中文

面向 TPU 的质量感知电压过压缩放框架:基于统计误差建模的能效与寿命提升

硬件体系结构 2024-07-18 v1

摘要

深度神经网络(DNN)是受人脑结构与功能启发而设计的人工智能模型,能够处理和从大量数据中学习,特别适合图像和语音识别等任务。然而,随着专用加速器如谷歌 Tensor Processing Units(TPU)的部署,DNN 的应用正在迎来快速增长。在大规模部署中,这些加速器的能源效率可能成为关键性关切。电压过压缩放(VOS)技术通过将系统运行电压降低至名义运行电压之上,来增加数字电路的能源效率和寿命。该技术通常在保持频率不变的情况下进行,导致时序错误。然而,某些应用如多媒体处理(包括 DNN)对错误和噪声具有内在韧性。本文利用 DNN 对错误和噪声的内在韧性,提出面向 TPU 的质量感知电压过压缩放框架,命名为 X-TPU,相较于传统 TPU 可实现更高的能源效率和寿命。X-TPU 框架由两个主要组成部分构成:支持运行时电压过压缩放的修改 TPU 架构,以及基于统计误差建模的算法,用于确定神经元的电压,确保输出质量保持在用户定义的质量阈值之上。我们使用 15 纳米 FinFET 技术合成了单个神经元架构,并在 various operating voltage levels 下提取了不同电压水平下的神经元统计误差模型。通过这些模型和所提出的算法,我们确定了每个神经元的合适电压。结果表明,X-TPU 上运行 DNN 可实现 32% 的能源节省,仅产生 0.6% 的精度损失。

关键词

引用

@article{arxiv.2407.12029,
  title  = {A Quality-Aware Voltage Overscaling Framework to Improve the Energy Efficiency and Lifetime of TPUs based on Statistical Error Modeling},
  author = {Alireza Senobari and Jafar Vafaei and Omid Akbari and Christian Hochberger and Muhammad Shafique},
  journal= {arXiv preprint arXiv:2407.12029},
  year   = {2024}
}