FoveaTer:用于图像分类的中央凹 Transformer
计算机视觉与模式识别
2022-10-04 v3
摘要
许多动物和人类以变化的空间分辨率(中央凹视觉)处理视野,并利用周边处理来产生眼动并将中央凹指向以获取关于感兴趣物体的高分辨率信息。该架构带来了计算高效的快速场景探索。近期基于自注意力的 Vision Transformers 取得了进展,作为传统依赖卷积的计算机视觉系统的替代方案。然而,Transformer 模型并未显式建模视觉系统的中央凹特性,也未建模眼动与分类任务之间的交互。我们提出中央凹 Transformer(FoveaTer)模型,其利用池化区域和眼动,通过 Vision Transformer 架构执行物体分类任务。使用方形池化区域或受生物启发的径向-极坐标池化区域,我们所提模型从卷积骨干网络池化图像特征,并将池化特征作为 Transformer 层的输入。它基于 Transformer 对过去与当前注视点各位置的注意力来决定后续注视位置,并在做出最终图像类别决策前,动态地将更多注视/计算资源分配给更具挑战性的图像。通过五项消融研究,我们评估了中央凹模型各组件的贡献。我们执行心理物理学场景分类任务,并利用实验数据寻找合适的径向-极坐标池化区域组合。我们还表明,在场景分类任务中,中央凹模型比基线模型更好地解释人类决策。我们展示了我们的模型在两类池化区域下对 PGD 对抗攻击的鲁棒性,其中可见中央凹模型优于基线模型。
引用
@article{arxiv.2105.14173,
title = {FoveaTer: Foveated Transformer for Image Classification},
author = {Aditya Jonnalagadda and William Yang Wang and B. S. Manjunath and Miguel P. Eckstein},
journal= {arXiv preprint arXiv:2105.14173},
year = {2022}
}