中文

基于大规模多头注意力的低延迟视觉变换器

计算机视觉与模式识别 2025-07-01 v1

摘要

最近的研究通过对单节点性能(SNP)的量化,展示了在分类任务中,多头注意力(MHA)在少数几个注意力头之间出现自发对称性破缺。此发现表明,每个注意力头通过其SNP之间的合作,聚焦于标签子集。我们将这种学习机制推广至大规模MHA(LS-MHA),采用单一矩阵值代表单头性能(SHP),类似于卷积神经网络(CNN)中单滤镜性能的度量。结果表明,每个SHP矩阵由多个单元簇组成,使得每个标签由少数几个注意力头以可忽略的噪声水平显式识别。这导致在变换器块之间信噪比(SNR)增加,从而提高分类准确率。这些特征催生了多个具有相同准确率但差异于LS-MHA结构的视觉变换器(ViT)架构。结果是,其软性委员会产出更高的准确率,而这在通常依赖大量滤镜的CNN中则少见。此外,在不影响准确率的前提下,通过替换初始变换器块为卷积层,实现了显著的延迟降低。该替换加速了早期阶段的学习,而随后由后续变换器层进行改进。基于CNN与ViT架构之间的定性差异,将这种学习机制扩展至自然语言处理任务,可能为深度学习领域提供新见解。我们使用在CIFAR-100数据集上训练的紧凑型卷积变换器架构演示了这些发现。

关键词

引用

@article{arxiv.2506.23832,
  title  = {Low-latency vision transformers via large-scale multi-head attention},
  author = {Ronit D. Gross and Tal Halevi and Ella Koresh and Yarden Tzach and Ido Kanter},
  journal= {arXiv preprint arXiv:2506.23832},
  year   = {2025}
}

备注

23 pages, 4 figures, 7 tables