中文

Vote&Mix:面向高效视觉 Transformer 的即插即用 Token 缩减

计算机视觉与模式识别 2024-09-02 v1

摘要

尽管视觉 Transformer (ViTs) 在各种视觉任务中取得了显著成功,但它们常常受到大量计算成本的阻碍。在这项工作中,我们引入了 Vote\&Mix (\textbf{VoMix}),一种即插即用且无需参数的 token 缩减方法,该方法无需任何训练即可直接应用于现成的 ViT 模型。VoMix 通过逐层 token 相似性投票机制识别具有高同质性的 token,从而解决 ViTs 的计算冗余问题。随后,将选定的 token 混合到保留集合中,从而保留视觉信息。实验表明,VoMix 在图像和视频上均显著改善了 ViTs 的速度-精度权衡。在无需任何训练的情况下,VoMix 使现有 ViT-H 在 ImageNet-1K 上的吞吐量提高了 2 倍,使现有 ViT-L 在 Kinetics-400 视频数据集上的吞吐量提高了 2.4 倍,而 top-1 准确率仅下降 0.3\%。

关键词

引用

@article{arxiv.2408.17062,
  title  = {Vote&Mix: Plug-and-Play Token Reduction for Efficient Vision Transformer},
  author = {Shuai Peng and Di Fu and Baole Wei and Yong Cao and Liangcai Gao and Zhi Tang},
  journal= {arXiv preprint arXiv:2408.17062},
  year   = {2024}
}