中文

探究注意力机制在深度学习中的工作原理

机器学习 2024-12-25 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

注意力机制已被广泛集成到Transformer和图注意力网络等主流神经网络架构中,但其背后的工作原理仍显含糊。其精髓是什么?它与传统机器学习算法之间是否存在任何联系?本研究检视了在流形学习、聚类和监督学习中使用经典度量和向量空间属性计算相似性的过程。我们识别了相似性计算和信息传播在这些方法中的关键特征,并演示了自注意力机制在深度学习中遵循相同原则,但运作更灵活和自适应。我们将自注意力机制分解为一个可学习的伪度量函数和基于相似性计算的信息传播过程。我们证明,只要伪度量是某个度量的变换且满足某些合理假设,自注意力机制通过连续建模可收敛为漂扩过程。该方程可通过新度量转化为热方程。此外,我们对具有通用伪度量函数的注意力机制进行一阶分析。该研究通过物理直觉帮助理解注意力机制的作用与原理。最后,我们提出一种名为度量注意力(metric-attention)的修改注意力机制,利用度量学习的概念以更有效地学习所需度量。实验结果表明,metric-attention 在训练效率、准确性和鲁棒性方面均优于自注意力机制。

关键词

引用

@article{arxiv.2412.18288,
  title  = {Towards understanding how attention mechanism works in deep learning},
  author = {Tianyu Ruan and Shihua Zhang},
  journal= {arXiv preprint arXiv:2412.18288},
  year   = {2024}
}

备注

38 pages, 6 figures