中文

层次化自注意力:将神经网络注意力机制推广到多尺度问题

机器学习 2025-09-22 v1 人工智能 神经与进化计算 机器学习

摘要

Transformer 及其注意力机制在机器学习领域具有革命性意义。虽然最初是为语言数据提出的,但它们很快找到了通往图像、视频、图等数据模态的路径,这些模态具有不同的信号几何结构。尽管具有这种多功能性,将注意力机制推广到数据以不同尺度呈现且可能来自不同模态的场景并不直接。目前在 Transformer 中整合层次结构和多模态的尝试主要基于临时启发式方法,这些方法无法无缝推广到具有不同结构的类似问题。为了解决这一问题,在本文中,我们采用了一种根本不同的方法:我们首先提出了一种数学构造来表示多模态、多尺度数据。然后,我们从熵最小化的第一性原理出发,数学地推导了所提出构造的神经网络注意力机制。我们证明,所推导的公式在最优意义上是标准的 Softmax 注意力最接近的,同时纳入了源自问题层次化/几何信息的归纳偏置。我们进一步提出了一种基于动态规划的高效算法来计算所推导的注意力机制。通过将其纳入 Transformer,我们证明了所提出的层次化注意力机制不仅可以用于从头训练层次化/多模态设置中的 Transformer 模型,还可以用于在训练后将层次化信息注入经典的预训练 Transformer 模型,从而以零样本方式获得更高效的模型。

关键词

引用

@article{arxiv.2509.15448,
  title  = {Hierarchical Self-Attention: Generalizing Neural Attention Mechanics to Multi-Scale Problems},
  author = {Saeed Amizadeh and Sara Abdali and Yinheng Li and Kazuhito Koishida},
  journal= {arXiv preprint arXiv:2509.15448},
  year   = {2025}
}

备注

In The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)