中文

CF-ViT:一种通用的视觉 Transformer 由粗到细方法

计算机视觉与模式识别 2022-11-22 v5

摘要

Vision Transformers(ViT)在计算机视觉任务中取得了诸多突破。然而,输入图像在空间维度上存在大量冗余,导致巨大的计算开销。因此,我们在本文中提出一种由粗到细的视觉 Transformer(CF-ViT),以在保持性能的同时减轻计算负担。我们提出的 CF-ViT 受现代 ViT 模型中两个重要观察的启发:(1)粗粒度图像块分割可定位输入图像中的信息区域。(2)大多数图像可通过小规模 token 序列的 ViT 模型得到良好识别。因此,我们的 CF-ViT 以两阶段方式执行网络推理。在粗推理阶段,输入图像被分割为小规模图像块序列以进行计算经济的分类。若未被良好识别,则识别信息块并在细粒度上进一步再分割。大量实验证明了我们 CF-ViT 的有效性。例如,在不牺牲任何性能的前提下,CF-ViT 减少了 LV-ViT 的 53% FLOPs,并实现了 2.01 倍吞吐量。

关键词

引用

@article{arxiv.2203.03821,
  title  = {CF-ViT: A General Coarse-to-Fine Method for Vision Transformer},
  author = {Mengzhao Chen and Mingbao Lin and Ke Li and Yunhang Shen and Yongjian Wu and Fei Chao and Rongrong Ji},
  journal= {arXiv preprint arXiv:2203.03821},
  year   = {2022}
}

备注

Accepted by AAAI 2023