中文

Vis-TOP:视觉 Transformer Overlay 处理器

计算机视觉与模式识别 2021-10-22 v1 硬件体系结构

摘要

近年来,Transformer 在自然语言处理(NLP)中取得良好结果,并已开始拓展至计算机视觉(CV),涌现出 Vision Transformer、Swin Transformer 等优秀模型。同时,Transformer 模型的平台扩展至嵌入式设备以满足某些资源敏感应用场景。然而,由于参数量大、计算流复杂及模型结构变体多,其硬件设计面临诸多待解决问题,既是机遇也是挑战。我们提出 Vis-TOP(Visual Transformer Overlay Processor),一种面向各类视觉 Transformer 模型的 overlay 处理器。它不同于 CPU、GPU、NPE 等粗粒度 overlay 处理器,也不同于针对特定模型的细粒度定制设计。Vis-TOP 总结所有视觉 Transformer 模型特征,实现三层两级变换结构,可在不改变硬件架构下自由切换或更改模型。同时,在三层两级变换结构中设计了相应指令包与硬件架构。对 Swin Transformer tiny 模型采用 8 位定点(fix_8)量化后,我们在 ZCU102 上实现该 overlay 处理器。相较 GPU,TOP 吞吐量高 1.5 倍;相较现有 Transformer 加速器,每 DSP 吞吐量介于他者 2.2 至 11.7 倍。总之,本文方法在资源消耗与推理速度上满足实时 AI 需求。Vis-TOP 基于可重构器件为边缘计算机视觉提供高性价比、低功耗方案。

关键词

引用

@article{arxiv.2110.10957,
  title  = {Vis-TOP: Visual Transformer Overlay Processor},
  author = {Wei Hu and Dian Xu and Zimeng Fan and Fang Liu and Yanxiang He},
  journal= {arXiv preprint arXiv:2110.10957},
  year   = {2021}
}

备注

13 pages, 5 figures