TransFG:一种用于细粒度识别的 Transformer 架构
计算机视觉与模式识别
2021-12-03 v5
摘要
细粒度视觉分类(FGVC)旨在从子类别中识别对象,由于固有的细微类间差异,是一项极具挑战性的任务。多数现有工作主要通过复用骨干网络提取已检测判别区域的特征来解决该问题。然而,该策略不可避免地使流程复杂化,并迫使所提区域包含对象的大部分,从而无法定位真正重要的部分。近来,视觉 transformer(ViT)在传统分类任务中展现出强劲性能。transformer 的自注意力机制将每个图像块 token 与分类 token 相连。本文中,我们首先评估 ViT 框架在细粒度识别设定下的有效性。进而受注意力连接强度可直观视为 token 重要性指标的启发,我们进一步提出一种可应用于大多数 transformer 架构的新颖部件选择模块,将 transformer 的所有原始注意力权重整合为注意力图,以引导网络有效且准确地选择判别性图像块并计算其关系。采用对比损失拉大易混淆类的特征表示间距离。我们将增强的基于 transformer 的模型命名为 TransFG,并在五个流行细粒度基准上实验证明其价值,取得了最先进性能。定性结果用以更好理解我们的模型。
引用
@article{arxiv.2103.07976,
title = {TransFG: A Transformer Architecture for Fine-grained Recognition},
author = {Ju He and Jie-Neng Chen and Shuai Liu and Adam Kortylewski and Cheng Yang and Yutong Bai and Changhu Wang},
journal= {arXiv preprint arXiv:2103.07976},
year = {2021}
}