中文

TinyDrop:面向视觉Transformer的轻量模型引导Token丢弃

计算机视觉与模式识别 2025-09-04 v1 人工智能

摘要

视觉Transformer(ViTs)在图像分类中取得了强大的性能,但由于处理所有图像token的成本较高,实际应用受到了限制。为在不牺牲准确性的前提下降低大型ViTs的推理成本,我们提出TinyDrop,一种由轻量级视觉模型引导的训练-free token丢弃框架。该框架通过估计token的重要性,在执行推理时实现对低重要性token的选择性丢弃,从而减轻大型ViT模型进行注意力计算的负担。该框架即插即用,无需 Architectural修改,兼容多种ViT架构。标准图像分类基准测试的评估表明,框架可使ViTs的FLOPs降低最高可达80%,同时保持最小的准确性下降,凸显了其广泛的泛化能力和实际效用,用于高效ViT-based分类。

关键词

引用

@article{arxiv.2509.03379,
  title  = {TinyDrop: Tiny Model Guided Token Dropping for Vision Transformers},
  author = {Guoxin Wang and Qingyuan Wang and Binhua Huang and Shaowu Chen and Deepu John},
  journal= {arXiv preprint arXiv:2509.03379},
  year   = {2025}
}