中文

累积的琐碎注意力在小数据集上的视觉Transformer中至关重要

计算机视觉与模式识别 2022-10-25 v1

摘要

视觉Transformer借助多头自注意力模块与多层感知机捕捉长程依赖的能力,在计算机视觉任务上展现出有竞争力的性能。然而,与卷积神经网络相比,计算全局注意力带来了另一劣势,即需要更多数据与计算才能收敛,这使其难以在小数据集上良好泛化,而小数据集在实际应用中十分常见。先前工作要么聚焦于从大数据集迁移知识,要么针对小数据集调整结构。在仔细审视自注意力模块后,我们发现琐碎注意力权重的数量远超重要权重,且由于其数量庞大,累积的琐碎权重在视觉Transformer的注意力中占主导地位,而注意力机制本身并未处理此问题。当琐碎注意力包含更多噪声时(例如某些骨干网络的浅层),这将掩盖有用的非琐碎注意力并损害性能。为解决该问题,我们提出通过阈值将注意力权重划分为琐碎与非琐碎两类,随后通过所提的琐碎权重抑制变换(TWIST)抑制累积的琐碎注意力(SATA)权重,以降低注意力噪声。在CIFAR-100与Tiny-ImageNet数据集上的大量实验表明,我们的抑制方法将视觉Transformer的准确率提升了至多2.3%。代码见 https://github.com/xiangyu8/SATA。

关键词

引用

@article{arxiv.2210.12333,
  title  = {Accumulated Trivial Attention Matters in Vision Transformers on Small Datasets},
  author = {Xiangyu Chen and Qinghao Hu and Kaidong Li and Cuncong Zhong and Guanghui Wang},
  journal= {arXiv preprint arXiv:2210.12333},
  year   = {2022}
}

备注

Camera-Ready Version for WACV 2023