中文

通过训练协议诱导视觉Transformer中的空间局部性

计算机视觉与模式识别 2026-05-19 v1 机器学习 机器学习

摘要

我们研究是否可以通过训练协议在不进行大规模预训练的情况下,诱导在Vision Transformer(ViT)早期层中的空间局部性。保持网络架构和优化程序不变,我们在CIFAR-10、CIFAR-100和Tiny-ImageNet上,对比Baseline协议与Modern协议(AutoAugment/ColorJitter、CutMix和Label Smoothing),通过平均注意力距离(Mean Attention Distance, MAD)和归一化熵来 characterize 每个注意力头。 在所有三个数据集上,Modern协议在早期层中产生更局部且更集中的注意力;在CIFAR-100上,最小MAD从Baseline的0.316降至Modern的0.008。为识别此效应的来源,我们在CIFAR-100上对每个组件进行独立添加或移除的消融实验。结果表明,CutMix是实验中的决定性因素:所有包含CutMix的条件的MAD为0.024,而所有不包含CutMix的条件保持在0.210。AutoAugment和Label Smoothing对局部性无独立影响。综合这些发现表明,CutMix导致的对部分图像区域的分类压力,可以促进Vision Transformer中局部注意力的出现。

关键词

引用

@article{arxiv.2605.16390,
  title  = {Inducing Spatial Locality in Vision Transformers through the Training Protocol},
  author = {Eduardo Santiago Toledo and Asael Fabian Martínez},
  journal= {arXiv preprint arXiv:2605.16390},
  year   = {2026}
}