SPFormer:利用超像素表示增强 Vision Transformer
计算机视觉与模式识别
2024-01-08 v1
摘要
在本工作中,我们引入了 SPFormer,一种由超像素表示增强的新型 Vision Transformer。针对传统 Vision Transformer 固定大小且非自适应的图像块划分的局限性,SPFormer 采用了适应图像内容的超像素。该方法将图像划分为不规则且语义连贯的区域,有效捕捉复杂细节,并适用于初始和中间特征层级。SPFormer 可端到端训练,在多个基准测试中展现出卓越的性能。值得注意的是,它在具有挑战性的 ImageNet 基准测试上取得了显著提升,分别比 DeiT-T 和 DeiT-S 提高了 1.4% 和 1.1%。SPFormer 的一个突出特点是其固有的可解释性。超像素结构为了解模型的内部过程提供了一扇窗口,提供了有价值的见解以增强模型的可解释性。这种程度的清晰度显著提升了 SPFormer 的鲁棒性,特别是在图像旋转和遮挡等具有挑战性的场景中,展示了其适应性和弹性。
引用
@article{arxiv.2401.02931,
title = {SPFormer: Enhancing Vision Transformer with Superpixel Representation},
author = {Jieru Mei and Liang-Chieh Chen and Alan Yuille and Cihang Xie},
journal= {arXiv preprint arXiv:2401.02931},
year = {2024}
}