中文

统一 CNN 与 Transformer 的底层学习机制揭示多头注意力共存机制

机器学习 2025-04-10 v3 计算机视觉与模式识别

摘要

卷积神经网络(CNN)评估输入图像中的短程相关性,并沿着各层推进;而视觉 Transformer(ViT)架构则使用由全连接层组成的重复 Transformer 编码器来评估长程相关性。两者均旨在解决复杂的分类任务,但视角不同。本研究表明,CNN 和 ViT 架构源于统一的底层学习机制,该机制定量测量前馈(FF)和多头注意力(MHA)子块中每个节点的单节点性能(SNP)。每个节点识别可能输出标签的小簇,额外的噪声表示为这些簇之外的标签。这些特征沿着 Transformer 编码器逐渐锐化,从而提高信噪比。这种统一的底层学习机制带来了两个主要发现。首先,它实现了一种高效的节点对角连接(ANDC)剪枝技术,且不影响准确率。其次,基于 SNP,MHA 头之间发生自发对称性破缺,使得每个头通过其 SNP 之间的合作将其注意力集中在一个标签子集上。因此,每个头成为识别其指定标签的专家,代表了一种定量的 MHA 共存机制。这种受统计力学启发的观点能够从每个节点的微观性能揭示整个网络的宏观行为。这些结果基于在 CIFAR-100 和 Flowers-102 数据集上训练的紧凑卷积 Transformer 架构,并呼吁将其扩展到其他架构和应用,如自然语言处理。

关键词

引用

@article{arxiv.2501.12900,
  title  = {Unified CNNs and transformers underlying learning mechanism reveals multi-head attention modus vivendi},
  author = {Ella Koresh and Ronit D. Gross and Yuval Meir and Yarden Tzach and Tal Halevi and Ido Kanter},
  journal= {arXiv preprint arXiv:2501.12900},
  year   = {2025}
}

备注

31 pages, 11 figures, A short YouTube Video describing the main results https://www.youtube.com/watch?v=7I8bp7UAudk