中文

使用哪些 token?探究视觉 Transformer 中的 token 缩减

计算机视觉与模式识别 2023-08-10 v1

摘要

自 Vision Transformer(ViT)提出以来,研究者一直试图通过去除所处理 token 中的冗余信息来提高 ViT 的效率。尽管已探索不同方法实现该目标,我们仍缺乏对这些方法所得缩减模式以及这些模式如何跨 token 缩减方法和数据集差异的理解。为弥补此不足,我们着手使用四个图像分类数据集理解 10 种不同 token 缩减方法的缩减模式。通过在不同分类任务上系统比较这些方法,我们发现 Top-K 剪枝方法是一个令人惊讶的强基线。通过对不同方法的深入分析,我们确定:当改变骨干模型容量时缩减模式通常不一致,基于剪枝的方法的缩减模式与固定放射状模式显著不同,且基于剪枝的方法的缩减模式在分类数据集间具有相关性。最后我们报告,缩减模式的相似性是模型性能的中度至强代理。项目页面 https://vap.aau.dk/tokens。

关键词

引用

@article{arxiv.2308.04657,
  title  = {Which Tokens to Use? Investigating Token Reduction in Vision Transformers},
  author = {Joakim Bruslund Haurum and Sergio Escalera and Graham W. Taylor and Thomas B. Moeslund},
  journal= {arXiv preprint arXiv:2308.04657},
  year   = {2023}
}

备注

ICCV 2023 NIVT Workshop. Project webpage https://vap.aau.dk/tokens