中文

近似R-Blocks CGRA映射与综合的统一框架

硬件体系结构 2025-05-30 v1

摘要

现代神经网络(NN)日益增加的复杂性和操作多样性,导致AI应用需要低功耗且高性能的边缘设备。粗粒度可重构架构(CGRA)构成了应对这些挑战的一种极具前景的设计范式,它在提供接近ASIC性能的同时允许硬件可编程性。在本文中,我们引入了一种新颖的端到端探索与综合框架,用于近似CGRA处理器,该框架能够将最先进的近似乘法组件透明且优化地集成并映射到CGRA中。我们的方法引入了一种逐通道探索策略,该策略基于精度下降约束将特定输出特征映射到近似组件上。这使得在保持精度高于特定阈值的同时优化系统能耗成为可能。在电路级,近似组件的集成使得创建在降低电压水平下运行的电压岛成为可能,这归因于其本质上更短的关键路径。这一关键使能因素使我们能够在所分析的架构中,平均降低30%的整体功耗(与其基线对应架构相比),而仅产生极小的2%面积开销。所提出的方法在ImageNet数据集上广泛使用的MobileNetV2模型上进行了评估,结果表明生成的架构在推理期间能够提供高达440 GOPS/W的能效,且输出误差相对较小,在吞吐量和能效方面优于多种最先进的CGRA架构。

关键词

引用

@article{arxiv.2505.23553,
  title  = {A Unified Framework for Mapping and Synthesis of Approximate R-Blocks CGRAs},
  author = {Georgios Alexandris and Panagiotis Chaidos and Alexis Maras and Barry de Bruin and Manil Dev Gomony and Henk Corporaal and Dimitrios Soudris and Sotirios Xydis},
  journal= {arXiv preprint arXiv:2505.23553},
  year   = {2025}
}