中文

DeViT:分解视觉Transformer用于边缘设备协同推理

计算机视觉与模式识别 2023-09-12 v1 分布式、并行与集群计算 性能

摘要

近年来,视觉Transformer(ViT)取得了巨大成功,在多个计算机视觉基准上达到了最先进的性能。然而,ViT模型参数量巨大且计算成本高,难以部署在资源受限的边缘设备上。现有方案大多将ViT模型压缩为紧凑模型,但仍无法实现实时推理。为解决此问题,我们提出探索Transformer结构的可分解性,将大型ViT分解为多个小模型,用于边缘设备上的协同推理。我们的目标是在保持与大型ViT相当精度的同时,实现快速且高能效的协同推理。为此,我们首先提出一种称为DeViT的协同推理框架,通过分解大型ViT来促进边缘部署。随后,我们设计了一种基于知识蒸馏的分解与集成算法,称为DEKD,以融合多个分解出的小模型,同时大幅降低通信开销,并通过开发特征匹配模块来处理异构模型,促进分解模型对大型ViT的模仿。在四个广泛使用的数据集上对三种代表性ViT骨干网络的大量实验表明,我们的方法实现了高效的ViT协同推理,优于现有的轻量级ViT,在效率与精度之间取得了良好权衡。例如,在GPU服务器上,与使用CIFAR-100的大型ViT(ViT-L/16)相比,我们的DeViT将端到端延迟提升了2.89×\times,仅牺牲1.65%的精度。DeViTs在ImageNet-1K上的精度超越近期高效ViT——MobileViT-S——3.54%,同时在边缘设备上运行速度快1.72×\times且能耗降低55.28%。

关键词

引用

@article{arxiv.2309.05015,
  title  = {DeViT: Decomposing Vision Transformers for Collaborative Inference in Edge Devices},
  author = {Guanyu Xu and Zhiwei Hao and Yong Luo and Han Hu and Jianping An and Shiwen Mao},
  journal= {arXiv preprint arXiv:2309.05015},
  year   = {2023}
}

备注

Accepted by IEEE Transactions on Mobile Computing