中文

从相互作用视角看(超)自注意力:表示、训练、泛化

机器学习 2025-06-09 v1 机器学习

摘要

自注意力已成为现代神经网络架构的核心组件,但其理论基础仍鲜为人知。本文通过将注意力机制视为相互作用实体(例如多智能体强化学习中的智能体或基因序列中的等位基因),展示了单层线性自注意力能够高效地表示、学习和泛化捕获两两相互作用的函数,包括超出分布场景。我们的分析揭示,自注意力在最低限度的训练中观察到的相互作用模式多样性假设下,充当相互作用学习器,从而涵盖广泛的真实世界领域。此外,我们通过实验验证了理论洞见,表明自注意力学习相互作用函数并在不同population分布和超出分布场景中实现泛化。基于我们的理论,我们引入了 HyperFeatureAttention,一种新型神经网络模块,旨在学习不同特征级别之间的相互作用耦合。进一步,我们提出了 HyperAttention,一种新模块,超越两两相互作用,捕获多实体依赖关系,如三方、四方或一般 n 方相互作用。

关键词

引用

@article{arxiv.2506.06179,
  title  = {A Theoretical Study of (Hyper) Self-Attention through the Lens of Interactions: Representation, Training, Generalization},
  author = {Muhammed Ustaomeroglu and Guannan Qu},
  journal= {arXiv preprint arXiv:2506.06179},
  year   = {2025}
}

备注

Accepted to ICML 2025