中文

Vision Transformer中无需微调的无损Token合并

计算机视觉与模式识别 2026-04-02 v2

摘要

虽然Vision Transformer(ViT)已成为计算机视觉中的标准架构,但其庞大的规模导致显著的计算开销。Token压缩技术引起了广泛关注,以解决此问题,但常常因严重信息丢失而需要 extensive additional training 才能实现实际性能。本文提出一种自适应Token合并(ATM)方法,确保无损Token合并,无需微调即可保持竞争性能。ATM通过仔细调整特定于层级的相似性阈值,在层级和batch之间自适应地减少token,从而防止与每个层级相比较不相似的token被合并。此外,ATM引入一种新颖的token匹配技术,考虑不仅相似性,还考虑合并规模,特别是针对最终层,以最小化每次合并操作造成的信息损失。我们在广泛的预训练模型上经验性地验证了该方法,表明ATM不仅超越了所有现有的无训练方法,还超过了大多数训练密集型方法,甚至无需额外训练。令人惊讶的是,无训练的ATM在DeiT-T和DeiT-S模型上实现了超过30%的FLOPs减少,同时未出现原始准确率的下降。

关键词

引用

@article{arxiv.2505.15160,
  title  = {Lossless Token Merging Even Without Fine-Tuning in Vision Transformers},
  author = {Jaeyeon Lee and Dong-Wan Choi},
  journal= {arXiv preprint arXiv:2505.15160},
  year   = {2026}
}

备注

ECAI 2025