中文

能量门控注意力与小波位置编码:变换器注意力的互补归纳偏置

机器学习 2026-05-27 v1 计算与语言 信号处理

摘要

标准变换器注意力计算成对 token 相似度,但不考虑输入信息结构, treating all tokens as equally salient and all positions as equally local。我们识别出标准注意力缺失的两种互补归纳偏置:能量显著性(哪些 token 浓缩信息能量,通过端到端学习而无需显式频率分解),以及尺度选择性局部性(位置影响在每个频率上的范围如何实现,通过 Morlet 小波编码)。我们通过两个简单组件来解决这两个问题。能量门控注意力(EGA)通过对 key token 嵌入的单个线性投影计算能量估计,对 value 聚合进行门控;它选择关注什么。Morlet 位置编码(MoPE)用学习的高斯窗小波取代固定正弦编码,使位置-频率局部化适应语料库;它指定注意力在每个尺度上的位置。 在 TinyShakespeare 上,EGA alone 相对于标准注意力实现 +0.092 验证损失改进(相对于 Phase 1-3 baseline 为 +0.103);MoPE alone 相对于 baseline 为 -0.032(作为独立编码表现较差);但它们的组合实现 +0.119——超过各自部分之和。这一超加性在两个独立训练运行中都观察到,是中心经验发现:显著性和局部性是互补的归纳偏置,每个都无法单独填补对方的空白。消融实验确认,结构化频谱先验(Morlet 小波门控、尺度初始化的 head、固定正弦位置编码)持续低于其无约束学习的对手,而互补的学习组件在超加性上相互作用。所有实验都在小规模(≤6M 参数、字符级基准、单一次随机种子)下进行;更大规模的多随机种子验证是最重要的未来工作方向。

关键词

引用

@article{arxiv.2605.26355,
  title  = {Energy-Gated Attention and Wavelet Positional Encoding: Complementary Inductive Biases for Transformer Attention},
  author = {Athanasios Zeris},
  journal= {arXiv preprint arXiv:2605.26355},
  year   = {2026}
}

备注

10 pages, 1 figure, 3 tables. Part 2 of a five-paper series on spectral methods in transformer attention. Code: https://github.com/AthanasiosZeris/energy-gated-attention