通过训练协议诱导视觉Transformer中的空间局部性
计算机视觉与模式识别
2026-05-19 v1 机器学习
机器学习
摘要
我们研究是否可以通过训练协议在不进行大规模预训练的情况下,诱导在Vision Transformer(ViT)早期层中的空间局部性。保持网络架构和优化程序不变,我们在CIFAR-10、CIFAR-100和Tiny-ImageNet上,对比Baseline协议与Modern协议(AutoAugment/ColorJitter、CutMix和Label Smoothing),通过平均注意力距离(Mean Attention Distance, MAD)和归一化熵来 characterize 每个注意力头。 在所有三个数据集上,Modern协议在早期层中产生更局部且更集中的注意力;在CIFAR-100上,最小MAD从Baseline的0.316降至Modern的0.008。为识别此效应的来源,我们在CIFAR-100上对每个组件进行独立添加或移除的消融实验。结果表明,CutMix是实验中的决定性因素:所有包含CutMix的条件的MAD为0.024,而所有不包含CutMix的条件保持在0.210。AutoAugment和Label Smoothing对局部性无独立影响。综合这些发现表明,CutMix导致的对部分图像区域的分类压力,可以促进Vision Transformer中局部注意力的出现。
引用
@article{arxiv.2605.16390,
title = {Inducing Spatial Locality in Vision Transformers through the Training Protocol},
author = {Eduardo Santiago Toledo and Asael Fabian Martínez},
journal= {arXiv preprint arXiv:2605.16390},
year = {2026}
}