中文

Token Merging:让你的 ViT 更快

计算机视觉与模式识别 2023-03-03 v3

摘要

我们提出 Token Merging(ToMe),一种无需训练即可提升现有 ViT 模型吞吐量的简单方法。ToMe 使用一种通用且轻量的匹配算法,在 transformer 中逐步合并相似 token,其速度可与剪枝媲美,同时精度更高。开箱即用,ToMe 能在图像上使最先进的 ViT-L @ 512 和 ViT-H @ 518 模型的吞吐量提升 2 倍,在视频上使 ViT-L 的吞吐量提升 2.2 倍,每种情况下精度仅下降 0.2-0.3%。ToMe 也可轻松应用于训练过程中,在实践中将视频上 MAE 微调的训练速度提升至多 2 倍。使用 ToMe 训练进一步最小化精度下降,使得 ViT-B 在音频上的吞吐量提升 2 倍,仅带来 0.4% 的 mAP 下降。从定性上看,我们发现 ToMe 将物体部件合并为一个 token,即使在视频的多帧中也是如此。总体而言,ToMe 在图像、视频和音频上的精度与速度均可与最先进水平竞争。

关键词

引用

@article{arxiv.2210.09461,
  title  = {Token Merging: Your ViT But Faster},
  author = {Daniel Bolya and Cheng-Yang Fu and Xiaoliang Dai and Peizhao Zhang and Christoph Feichtenhofer and Judy Hoffman},
  journal= {arXiv preprint arXiv:2210.09461},
  year   = {2023}
}

备注

Accepted ICLR 2023 Oral (top 5%) [final v2]. This version includes stable diffusion experiments. See code at https://github.com/facebookresearch/ToMe