中文

几何注意力:Transformer 注意力的机制显式算子语义

机器学习 2026-01-21 v1 人工智能

摘要

几何注意力通过四个独立输入来指定一个注意力层:有限载体(哪些索引是可寻址的)、证据核规则(掩码的原分数与链接如何诱导非负权重)、探针族(哪些观测量被视为可接受的)以及锚定/更新规则(选择哪个代表性核以及如何应用它)。探针族在核上诱导出操作等价关系,从而产生一个规范;锚点相对于该探针选择代表。在标量关系工作表示与证据的乘法合成律下,可接受的链接族是指数型的,产生 Gibbs 权重;在行锚定下,这包含了作为子机制的 softmax 核族。在对一元行/列分数场进行商运算后,剩余的交互分量允许标准的秩-r 范式(Eckart-Young/SVD);点积分数图实现了相应的低秩交互机制。固定载体并将更新外延化,产生标准的固定 token Transformer 注意力算子;允许载体更新则产生自适应载体与分级深度机制。该算子语言还支持多头/混合核、基于计划的锚点(例如,entropic OT/Sinkhorn)以及一元算子(例如,FFN 风格的场)作为显式的机制选择。这分离了不变结构与建模选择,实现了对注意力机制及基于注意力的架构的原则性比较与扩展。

关键词

引用

@article{arxiv.2601.11618,
  title  = {Geometric Attention: A Regime-Explicit Operator Semantics for Transformer Attention},
  author = {Luis Rosario Freytes},
  journal= {arXiv preprint arXiv:2601.11618},
  year   = {2026}
}

备注

57 pages