中文

FlexSA:面向高效剪枝 DNN 模型训练的灵活 systolic array 架构

机器学习 2020-04-29 v1 硬件体系结构

摘要

现代深度学习模型具有高昂的内存与计算成本。为使模型快速且内存高效,常采用结构化模型剪枝。我们发现,使用带有大型 systolic array 的通用训练加速器来剪枝模型时性能极低效。为使 systolic array 在剪枝与训练中高效,我们提出 FlexSA,一种灵活的 systolic array 架构。FlexSA 动态重构 systolic array 结构,并提供多种子 systolic 运行模式,专为以高能效与内存带宽高效的方式处理不同尺寸与形状张量而设计。我们还提出一种编译启发式方法,用于将训练负载中的矩阵乘加操作分块,以最佳利用 FlexSA 的资源。基于我们的评估,采用所提编译启发式方法的 FlexSA 相比带有大型 systolic array 的传统训练加速器,在剪枝与训练现代 CNN 模型时将计算资源利用率提升了 37%。FlexSA 还将片上数据复用提升 1.7 倍,相比朴素 systolic array 拆分节省 28% 能耗。

关键词

引用

@article{arxiv.2004.13027,
  title  = {FlexSA: Flexible Systolic Array Architecture for Efficient Pruned DNN Model Training},
  author = {Sangkug Lym and Mattan Erez},
  journal= {arXiv preprint arXiv:2004.13027},
  year   = {2020}
}