中文

LF-ViT:减少视觉Transformer中的空间冗余以实现高效图像识别

计算机视觉与模式识别 2024-02-02 v1 人工智能

摘要

视觉Transformer(ViT)在处理高分辨率图像时精度卓越,但面临显著的空间冗余挑战,导致计算和内存需求增加。为解决此问题,我们提出了定位与聚焦视觉Transformer(LF-ViT)。该模型通过策略性地削减计算需求而不影响性能来运行。在定位阶段,处理一张降低分辨率的图像;如果无法得出确定的预测,我们首创的邻域全局类别注意力(NGCA)机制将被触发,基于初步发现有效识别并突出类别判别性区域。随后,在聚焦阶段,从原始图像中使用该指定区域以增强识别。独特的是,LF-ViT在两个阶段使用一致的参数,确保了无缝的端到端优化。我们的实证测试证实了LF-ViT的能力:它显著地将Deit-S的FLOPs降低了63%,同时将吞吐量提升了两倍。本项目的代码位于 https://github.com/edgeai1/LF-ViT.git。

关键词

引用

@article{arxiv.2402.00033,
  title  = {LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition},
  author = {Youbing Hu and Yun Cheng and Anqi Lu and Zhiqiang Cao and Dawei Wei and Jie Liu and Zhijun Li},
  journal= {arXiv preprint arXiv:2402.00033},
  year   = {2024}
}