中文

迈向对注意力机制有效性的理解

计算机视觉与模式识别 2021-06-30 v1 机器学习

摘要

注意力机制是一种广泛用于提升卷积神经网络(CNNs)在计算机视觉任务上性能的方法。尽管其无处不在,我们对其有效性来源的理解却很薄弱。人们普遍认为是视觉注意力解释导致了其有效性,即主张关注输入数据的重要部分而非接收整个输入。在本文中,我们发现特征的注意力权重与其重要性之间仅存在微弱的一致性。相反,我们验证了特征图乘法在注意力机制中的关键作用,并揭示了特征图乘法对 CNNs 所学景观的根本影响:借助特征图乘法带来的高阶非线性,它对 CNNs 起到了正则化作用,使其相比原始 CNNs 在真实样本附近学习到更平滑、更稳定的景观。这种平滑与稳定性诱导了真实样本之间更具预测性且更稳定的行为,并使 CNNs 生成得更好。此外,受所提出的特征图乘法有效性的启发,我们通过简单地将 ResNet 中的特征图加法替换为特征图乘法,设计了特征图乘法网络(FMMNet)。FMMNet 在多个数据集上优于 ResNet,这表明即使没有现有方法中精细设计的注意力机制,特征图乘法在提升性能方面也起着至关重要的作用。

关键词

引用

@article{arxiv.2106.15067,
  title  = {Towards Understanding the Effectiveness of Attention Mechanism},
  author = {Xiang Ye and Zihang He and Heng Wang and Yong Li},
  journal= {arXiv preprint arXiv:2106.15067},
  year   = {2021}
}