M2Former:面向细粒度视觉识别的多尺度块选择
计算机视觉与模式识别
2024-10-08 v1
摘要
近来,视觉Transformer(ViT)已被积极应用于细粒度视觉识别(FGVR)。ViT可通过固有的自注意力机制有效建模分块物体区域间的相互依赖关系。此外,块选择常与ViT配合使用,以去除冗余块信息并突出最具判别力的物体块。然而,现有基于ViT的FGVR模型局限于单尺度处理,其固定感受野阻碍了表示的丰富性并加剧了对尺度变化的脆弱性。因此,我们提出多尺度块选择(MSPS)以提升现有基于ViT模型的多尺度能力。具体而言,MSPS在多尺度视觉Transformer(MS-ViT)的不同阶段选择不同尺度的显著块。此外,我们引入类令牌迁移(CTT)与多尺度交叉注意力(MSCA)来建模所选多尺度块间的跨尺度交互,并充分反映于模型决策中。与先前的单尺度块选择(SSPS)相比,我们提出的MSPS基于特征层次鼓励更丰富的物体表示,并一致地从小尺寸到大尺寸物体提升性能。最终,我们提出M2Former,在多个广泛使用的FGVR基准上优于基于CNN/ViT的模型。
引用
@article{arxiv.2308.02161,
title = {M2Former: Multi-Scale Patch Selection for Fine-Grained Visual Recognition},
author = {Jiyong Moon and Junseok Lee and Yunju Lee and Seongsik Park},
journal= {arXiv preprint arXiv:2308.02161},
year = {2024}
}