中文

GFT:梯度焦点变换器

计算机视觉与模式识别 2025-04-15 v1

摘要

细粒度图像分类(Fine-Grained Image Classification, FGIC)是计算机视觉中的复杂任务,需模型区分具有细微局部视觉差异的类别。已研究的基于卷积神经网络(CNN)的模型虽在局部特征提取方面表现强劲,却常难以捕获细粒度识别所需的全局上下文信息;而更近期基于ViT(Vision Transformer)的模型则通过注意力机制解决FGIC问题,但缺乏对真正判别性区域的自适应聚焦能力。TransFG 等基于ViT的扩展方法引入了基于部件的token选择以增强注意力局部化,但仍面临计算效率、注意力区域选择灵活性以及在复杂环境下的细节聚焦叙事等挑战。本文引入GFT(Gradient Focal Transformer),一个为FGIC任务量身定制的新型ViT衍生框架。GFT集成了梯度注意力学习对齐(Gradient Attention Learning Alignment, GALA)机制,通过分析注意力梯度流动态优先级选取具有判别性的特征;同时搭配渐进式patch选择(Progressive Patch Selection, PPS)策略,逐步过滤信息不足的区域,减少计算负担,同时增强对细节的敏感性。GFT在FGVC Aircraft、Food-101和COCO数据集上实现SOTA准确率,参数量为9300万,超越基于ViT的先进FGIC模型在效率方面表现更佳。通过桥接全局上下文与局部细节提取,GFT在细粒度识别领域树立了新的基准,为实际部署场景提供可解释性解决方案。

关键词

引用

@article{arxiv.2504.09852,
  title  = {GFT: Gradient Focal Transformer},
  author = {Boris Kriuk and Simranjit Kaur Gill and Shoaib Aslam and Amir Fakhrutdinov},
  journal= {arXiv preprint arXiv:2504.09852},
  year   = {2025}
}

备注

11 pages, 3 tables, 5 figures