中文

一种适用于多种骨干神经网络的通用共享注意力机制

计算机视觉与模式识别 2024-04-11 v2 人工智能

摘要

自注意力机制已成为提升各类骨干神经网络性能的关键组件。然而,当前主流方法理所当然地将新设计的自注意力模块(SAMs)逐层独立地嵌入网络各层,却未充分挖掘其参数的潜力。这导致随着网络深度增加,性能次优且参数消耗上升。为改进这一范式,本文首先呈现一个反直觉但固有的现象:SAMs 在不同层间倾向于产生强相关的注意力图,平均皮尔逊相关系数高达 0.85。受此固有观察启发,我们提出稠密隐式注意力(DIA),其直接跨层共享 SAMs,并采用长短期记忆模块来校准与桥接不同层间高度相关的注意力图,从而提升 SAMs 的参数利用效率。DIA 的这一设计亦与神经网络的动力系统视角相一致。通过大量实验,我们证明了简单而有效的 DIA 能持续提升多种网络骨干(包括 ResNet、Transformer 和 UNet)在图像分类、目标检测及基于扩散模型的图像生成等任务上的表现。

关键词

引用

@article{arxiv.2210.16101,
  title  = {A Generic Shared Attention Mechanism for Various Backbone Neural Networks},
  author = {Zhongzhan Huang and Senwei Liang and Mingfu Liang and Liang Lin},
  journal= {arXiv preprint arXiv:2210.16101},
  year   = {2024}
}

备注

Work in progress. arXiv admin note: text overlap with arXiv:1905.10671