中文

视觉 Transformer 中学习合并令牌

计算机视觉与模式识别 2022-02-25 v1 机器学习

摘要

Transformer 被广泛用于解决自然语言理解与计算机视觉任务。虽然扩大这些架构的规模可带来性能提升,但往往以高得多的计算成本为代价。为使大规模模型在真实世界系统中保持实用,需要降低其计算开销。在这项工作中,我们提出 PatchMerger,一个简单模块,通过在两个连续中间层之间合并补丁或令牌来减少网络必须处理的补丁或令牌数量。我们表明,PatchMerger 在各种模型规模下均实现了显著加速,同时在微调后于上游与下游均匹配原始性能。

关键词

引用

@article{arxiv.2202.12015,
  title  = {Learning to Merge Tokens in Vision Transformers},
  author = {Cedric Renggli and André Susano Pinto and Neil Houlsby and Basil Mustafa and Joan Puigcerver and Carlos Riquelme},
  journal= {arXiv preprint arXiv:2202.12015},
  year   = {2022}
}

备注

11 pages, 9 figures