中文

基于视觉 Transformer 的全局-局部相似性用于高精细图像识别

计算机视觉与模式识别 2024-07-19 v1

摘要

细粒度识别涉及来自从属宏观类别的图像分类,由于类别间差异很小,具有挑战性。为克服这一问题,大多数方法都采用由特征提取主干网络 followed by 高阶特征细化步骤启用的判别性特征选择。在最近的许多研究中,已显示视觉 Transformer 作为特征提取主干对于细粒度识别具有潜力,但其使用注意力机制选择判别性 token 的方式计算成本较高。在本工作中,我们提出了一种新型且计算开销较低的指标,用于识别图像中的判别性区域。我们比较由分类用的可学习 token(CLS token)给出的图像全局表示与单个 patch 的局部表示之间的相似性。我们选择与之相似性最高的区域获取裁剪区域,这些区域通过相同的 transformer 编码器进行前向传递。最后,在原始和裁剪表示之间进一步细化高阶特征,以实现更稳健的预测。通过广泛的实验评估,我们证明了所提出方法的有效性,在各种数据集上实现了有利的结果。此外,我们的方法在计算成本上显著低于替代方案。代码和模型 checkpoint 可在 \url{https://github.com/arkel23/GLSim} 获取。

关键词

引用

@article{arxiv.2407.12891,
  title  = {Global-Local Similarity for Efficient Fine-Grained Image Recognition with Vision Transformers},
  author = {Edwin Arkel Rios and Min-Chun Hu and Bo-Cheng Lai},
  journal= {arXiv preprint arXiv:2407.12891},
  year   = {2024}
}

备注

Main: 12 pages, 5 figures, 5 tables. Appendix: 9 pages, 9 figures, 10 tables. Total: 21 pages, 14 figures, 15 tables