SATA:基于空间自相关记号分析提升视觉转换器鲁棒性
计算机视觉与模式识别
2024-10-01 v1 机器学习
摘要
过去几年,视觉转换器 (ViT) 在 various 视觉识别任务上持续展现出惊人的性能。然而,提升其鲁棒性的尝试往往成效有限,主要聚焦于不同的训练策略、输入 patch 增强或网络结构改进。这些方法通常需要大量训练和微调,耗时耗资源。为克服这些障碍,我们引入一种新方法,称为空间自相关记号分析 (SATA)。通过利用记号特征之间的空间关系,SATA 提升了 ViT 模型的表征能力和鲁棒性。这通过对记号根据其空间自相关得分进行分析和分组来实现,其在自注意力机制的前馈网络 (FFN) 单元输入前进行处理。重要的是,SATA 可无缝集成到现有的预训练 ViT 基线中,无需重新训练或额外微调,同时通过降低 FFN 单元的计算负担提升效率。实验结果表明,增强的基线 ViT 不仅在 ImageNet-1K 图像分类中取得了新的最佳 top-1 准确率 (94.9%),还在多个鲁棒性基准测试中实现了新的最佳性能,包括 ImageNet-A (top-1=63.6%)、ImageNet-R (top-1=79.2%) 和 ImageNet-C (mCE=13.6%),均无需对基线模型进行额外训练或微调。
引用
@article{arxiv.2409.19850,
title = {SATA: Spatial Autocorrelation Token Analysis for Enhancing the Robustness of Vision Transformers},
author = {Nick Nikzad and Yi Liao and Yongsheng Gao and Jun Zhou},
journal= {arXiv preprint arXiv:2409.19850},
year = {2024}
}