中文

SmartMem:面向移动设备高效DNN执行的布局转换消除与适配

机器学习 2024-04-23 v1 人工智能 分布式、并行与集群计算

摘要

本工作受深入神经网络(尤其是支撑ChatGPT等应用的Transformer架构)的最新发展以及在移动设备上进行推理需求的驱动。我们关注具有计算效率的Swin类架构的Transformer(具体即带有局部和全局注意力的Transformer),以及基于Transformer的大型模型(如Stable Diffusion和LLM)。我们注意到,计算算子之间的布局转换在这些应用中造成了显著的性能下降。本文提出SmartMem,一个综合性的框架,用于消除大部分布局转换,核心思想是通过谨慎选择布局和实现算子,使得多个算子能够共享相同的张量布局。我们的做法基于将算子分为四组,并考虑生产者-消费者算子之间的组合。我们开发了一组用于搜索此类布局的方法。我们工作的另一个组成部分是为常见于移动设备的2.5维内存开发高效内存布局。我们的实验结果表明,SmartMem在18种多样化的神经网络(包括CNN、具有局部和全局注意力的Transformer以及LLM)上,超过了5个最先进的DNN执行框架。特别是,与DNNFusion相比,SmartMem平均加速2.8倍;与TVM和MNN相比,分别实现了6.9倍和7.9倍的平均加速。

关键词

引用

@article{arxiv.2404.13528,
  title  = {SmartMem: Layout Transformation Elimination and Adaptation for Efficient DNN Execution on Mobile},
  author = {Wei Niu and Md Musfiqur Rahman Sanim and Zhihao Shu and Jiexiong Guan and Xipeng Shen and Miao Yin and Gagan Agrawal and Bin Ren},
  journal= {arXiv preprint arXiv:2404.13528},
  year   = {2024}
}