中文

ML模型稀疏与不规则张量计算的硬件加速:综述与洞察

硬件体系结构 2021-08-11 v2 计算机视觉与模式识别 分布式、并行与集群计算 机器学习 神经与进化计算

摘要

机器学习(ML)模型被广泛用于许多重要领域。为高效处理这些计算与内存密集型应用,这些过参数化模型的张量通过利用稀疏性、尺寸缩减和张量量化被压缩。非结构稀疏性与变维张量产生不规则的计算、通信与内存访问模式;以常规方式在硬件加速器上处理它们并不能天然利用加速机会。本文全面综述了ML模型稀疏与不规则张量计算在硬件加速器上的高效执行。特别地,它讨论了架构设计中的增强模块与软件支持;对不同的硬件设计与加速技术进行分类,并从硬件与执行代价角度分析;分析近期DNN可实现的加速;从硬件/软件/模型协同设计优化(模块间/模块内)角度突出进一步机会。本文要点包括:理解加速稀疏、不规则形状与量化张量的关键挑战;理解加速器系统中为支持其高效计算所作的增强;分析在编码、存储、提取、通信、计算与非零元素负载均衡的特定设计选择中的权衡;理解结构化稀疏如何提升存储效率并均衡计算;理解如何在加速器上编译与映射带稀疏张量的模型;理解近期高效加速的设计趋势与进一步机会。

关键词

引用

@article{arxiv.2007.00864,
  title  = {Hardware Acceleration of Sparse and Irregular Tensor Computations of ML Models: A Survey and Insights},
  author = {Shail Dave and Riyadh Baghdadi and Tony Nowatzki and Sasikanth Avancha and Aviral Shrivastava and Baoxin Li},
  journal= {arXiv preprint arXiv:2007.00864},
  year   = {2021}
}

备注

Accepted for publication in Proceedings of the IEEE