中文

M$^3$ViT:基于模型-加速器协同设计的高效多任务学习混合专家视觉 Transformer

计算机视觉与模式识别 2022-10-27 v1

摘要

多任务学习(MTL)将多个学习任务封装在单个模型中,通常使这些任务能够更好地联合学习。然而,当将 MTL 部署到那些通常资源受限或对延迟敏感的现实世界系统时,出现了两个突出的挑战:(i) 在训练期间,由于任务间的梯度冲突,同时优化所有任务通常很困难;(ii) 在推理时,当前的 MTL 机制必须激活几乎整个模型,即使只是为了执行单个任务。然而,大多数真实系统在每个时刻只需要一两个任务,并根据需要在任务之间切换:因此,这种全任务激活的推理也高度低效且不可扩展。在本文中,我们提出了一个模型-加速器协同设计框架,以实现高效的端侧 MTL。我们的框架被称为 M3^3ViT,将混合专家层定制到用于 MTL 的视觉 Transformer 主干中,并在训练期间稀疏激活任务特定的专家。然后在任何感兴趣任务的推理时,相同的设计允许仅激活任务对应的稀疏专家路径,而不是整个模型。我们的新模型设计进一步通过硬件层面的创新得到增强,特别是为内存受限的 MTL 量身定制的一种新颖的计算重排方案,该方案实现了任务间的零开销切换,并且可以扩展到任意数量的专家。在执行单任务推理时,M3^{3}ViT 比以编码器为中心的 MTL 方法获得了更高的准确率,同时显著减少了 88% 的推理 FLOPs。在 Xilinx ZCU104 FPGA 硬件平台上实现时,我们的协同设计框架将内存需求降低了 2.4 倍,同时能效比同类的 FPGA 基线高出 9.23 倍。代码可在以下地址获取:https://github.com/VITA-Group/M3ViT。

关键词

引用

@article{arxiv.2210.14793,
  title  = {M$^3$ViT: Mixture-of-Experts Vision Transformer for Efficient Multi-task Learning with Model-Accelerator Co-design},
  author = {Hanxue Liang and Zhiwen Fan and Rishov Sarkar and Ziyu Jiang and Tianlong Chen and Kai Zou and Yu Cheng and Cong Hao and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2210.14793},
  year   = {2022}
}