面向最小化 DNN 加速器片外数据访问的调度、内存分配与张量替换联合优化
机器学习
2023-12-01 v1 硬件体系结构
摘要
专用硬件加速器已广泛用于深度神经网络(DNNs)以提供功耗/性能优势。这些加速器包含支持 DNN 算子的专用硬件,以及用于存储张量操作数的暂存存储器。通常,暂存存储器的容量不足以存储计算所需的所有张量,因此在计算过程中需要额外的数据访问来在主机内存与暂存存储器之间来回移动张量,带来显著的功耗/性能开销。这些额外数据访问的量取决于算子调度以及内存分配(为张量在暂存存储器中选定的具体位置)。我们提出了一个名为 COSMA 的优化框架,用于将 DNN 映射到加速器上,该框架寻找最优的算子调度、内存分配与张量替换以最小化额外数据访问。COSMA 提供了整数线性规划(ILP)公式,针对给定的暂存存储器大小为 DNN 到加速器的映射生成最优解。我们证明,使用现成的 ILP 求解器,COSMA 在数秒内即可为多种不同应用的前沿 DNN 获得最优解。此外,它相较现有方法平均减少了 84% 的非必需数据访问。我们进一步提出了一种分治启发式方法以扩展到由神经架构搜索生成的某些复杂 DNN,该启发式解相较其他工作平均减少了 85% 的数据访问。
引用
@article{arxiv.2311.18246,
title = {Combined Scheduling, Memory Allocation and Tensor Replacement for Minimizing Off-Chip Data Accesses of DNN Accelerators},
author = {Yi Li and Aarti Gupta and Sharad Malik},
journal= {arXiv preprint arXiv:2311.18246},
year = {2023}
}