中文

再剪裁一个token即可:利用时延-负载非线性关系在边缘设备上部署Vision Transformer

机器学习 2024-11-12 v4 计算机视觉与模式识别

摘要

本文探讨如何有效地在边缘设备上部署针对小负载的视觉变换器。最近的研究方法通过删除或合并token来降低变换器神经网络的时延, 但仅有少量精度下降。然而, 这些方法并未就边缘设备部署进行设计:它们未利用时延-负载趋势的信息来提高效率。我们在此工作中解决了这一不足。首先, 我们确定影响ViT时延-负载关系的因素。其次, 通过利用时延-负载的非线性关系, 我们确定了token剪裁方案。最后, 我们展示了一种基于此方案的、训练无需的token剪裁方法。我们表明, 其他方法可能使时延增加2-30%, 而我们通过减少9-26%来降低时延。对于类似时延(在5.2%或7ms以内)的设备, 我们实现了78.6%-84.5%的ImageNet1K精度, 而最新方法Token Merging实现了45.8%-85.4%的精度。

关键词

引用

@article{arxiv.2407.05941,
  title  = {Pruning One More Token is Enough: Leveraging Latency-Workload Non-Linearities for Vision Transformers on the Edge},
  author = {Nick John Eliopoulos and Purvish Jajal and James C. Davis and Gaowen Liu and George K. Thiravathukal and Yung-Hsiang Lu},
  journal= {arXiv preprint arXiv:2407.05941},
  year   = {2024}
}