用于细粒度分类的显著掩码引导视觉Transformer
计算机视觉与模式识别
2024-01-03 v1 人工智能
摘要
细粒度视觉分类(FGVC)是一项具挑战性的计算机视觉任务,旨在自动识别 subordinate 类别的对象。其主要困难之一在于捕捉视觉相似类别间最具判别性的类间差异。近期,基于 Vision Transformer(ViT)的方法在 FGVC 中取得显著成果,通常通过自注意力机制结合额外高资源消耗技术来区分潜在判别区域而忽略其余部分。然而,此类方法仅依赖固有自注意力机制,可能难以有效聚焦于真正判别性区域,导致分类 token 易从次要背景块聚合全局信息。此外,由于数据点极度匮乏,分类器可能未能发现最有助的类间区分特征,因为其他无关但独特的背景区域可能被误认作有价值。为此,我们提出简洁而高效的显著掩码引导视觉 Transformer(SM-ViT),通过对潜在判别前景区域进行显著掩码,增强标准 ViT 注意力图的可判别性。大量实验表明,采用标准训练流程,我们的 SM-ViT 在流行 FGVC 基准上以更少资源与更低输入图像分辨率取得优于现有基于 ViT 方法的 SOTA 性能。
引用
@article{arxiv.2305.07102,
title = {Salient Mask-Guided Vision Transformer for Fine-Grained Classification},
author = {Dmitry Demidov and Muhammad Hamza Sharif and Aliakbar Abdurahimov and Hisham Cholakkal and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2305.07102},
year = {2024}
}
备注
Accepted by VISAPP 2023 (Best Student Paper Award)