Token Compensator:无需重新调参即可改变视觉 Transformer 的推理成本
计算机视觉与模式识别
2024-08-14 v1
摘要
Token 压缩通过减少冗余 token 的数量(例如修剪不够注意力的 token 或合并相似的 token)来加速视觉 Transformer(ViT)的训练和推理。然而,这些方法在训练和推理阶段的压缩程度不匹配时,会导致下游任务性能显著下降,限制了其在无需重新训练的模型上的应用。在本文中,我们提出一种模型算术框架,以解耦两个阶段的压缩程度。首先,我们对预训练模型进行快速参数高效的自蒸馈阶段,以获得一个名为 Token Compensator(ToCom)的小型插件,用于描述不同压缩程度之间模型的差距。在推理阶段,ToCom 可直接插入任何下游无需重新训练的模型中,以应对任意不匹配的训练和推理压缩程度,从而获得普适的性能提升。实验在超过 20 个下游任务上表明,我们方法的有效性。在 CIFAR100 上进行细粒度视觉分类和 VTAB-1k 上,ToCom 可分别为 DeiT-B 提升最高达 2.3%、1.5% 和 2.0% 的平均性能。代码:https://github.com/JieShibo/ToCom
引用
@article{arxiv.2408.06798,
title = {Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning},
author = {Shibo Jie and Yehui Tang and Jianyuan Guo and Zhi-Hong Deng and Kai Han and Yunhe Wang},
journal= {arXiv preprint arXiv:2408.06798},
year = {2024}
}
备注
Accepted to ECCV2024