GFT:梯度焦点变换器
计算机视觉与模式识别
2025-04-15 v1
摘要
细粒度图像分类(Fine-Grained Image Classification, FGIC)是计算机视觉中的复杂任务,需模型区分具有细微局部视觉差异的类别。已研究的基于卷积神经网络(CNN)的模型虽在局部特征提取方面表现强劲,却常难以捕获细粒度识别所需的全局上下文信息;而更近期基于ViT(Vision Transformer)的模型则通过注意力机制解决FGIC问题,但缺乏对真正判别性区域的自适应聚焦能力。TransFG 等基于ViT的扩展方法引入了基于部件的token选择以增强注意力局部化,但仍面临计算效率、注意力区域选择灵活性以及在复杂环境下的细节聚焦叙事等挑战。本文引入GFT(Gradient Focal Transformer),一个为FGIC任务量身定制的新型ViT衍生框架。GFT集成了梯度注意力学习对齐(Gradient Attention Learning Alignment, GALA)机制,通过分析注意力梯度流动态优先级选取具有判别性的特征;同时搭配渐进式patch选择(Progressive Patch Selection, PPS)策略,逐步过滤信息不足的区域,减少计算负担,同时增强对细节的敏感性。GFT在FGVC Aircraft、Food-101和COCO数据集上实现SOTA准确率,参数量为9300万,超越基于ViT的先进FGIC模型在效率方面表现更佳。通过桥接全局上下文与局部细节提取,GFT在细粒度识别领域树立了新的基准,为实际部署场景提供可解释性解决方案。
引用
@article{arxiv.2504.09852,
title = {GFT: Gradient Focal Transformer},
author = {Boris Kriuk and Simranjit Kaur Gill and Shoaib Aslam and Amir Fakhrutdinov},
journal= {arXiv preprint arXiv:2504.09852},
year = {2025}
}
备注
11 pages, 3 tables, 5 figures