中文

Token Fusion:弥合 Token 剪枝与 Token 合并之间的差距

计算机视觉与模式识别 2023-12-05 v1

摘要

Vision Transformer (ViT) 已成为计算机视觉中强大的骨干网络,性能优于许多传统 CNN。然而,其计算开销(主要归因于自注意力机制)使得在资源受限的边缘设备上进行部署具有挑战性。多种解决方案依赖于 Token 剪枝或 Token 合并。在本文中,我们引入了“Token Fusion”(ToFu),一种融合了 Token 剪枝和 Token 合并优势的方法。当模型对输入插值表现出敏感性时,Token 剪枝具有优势;而当模型对输入表现出接近线性的响应时,Token 合并则很有效。我们将此结合起来,提出了一种名为 Token Fusion 的新方案。此外,我们解决了平均合并的局限性,该合并不保留内在特征范数,从而导致分布偏移。为了缓解这一问题,我们引入了 MLERP 合并,这是 SLERP 技术的一种变体,专为合并多个 Token 同时保持范数分布而定制。ToFu 用途广泛,适用于带有或不带有额外训练的 ViT。我们的实证评估表明,ToFu 在计算效率和模型准确率方面的分类和图像生成任务中均确立了新的基准。

关键词

引用

@article{arxiv.2312.01026,
  title  = {Token Fusion: Bridging the Gap between Token Pruning and Token Merging},
  author = {Minchul Kim and Shangqian Gao and Yen-Chang Hsu and Yilin Shen and Hongxia Jin},
  journal= {arXiv preprint arXiv:2312.01026},
  year   = {2023}
}

备注

To appear in WACV 2024