中文

元注意力:用于高效Transformer推理的贝叶斯逐Token路由

机器学习 2026-05-28 v1

摘要

标准Transformer架构对所有token和序列位置统一应用单一注意力机制,而不考虑局部上下文或计算预算。我们提出元注意力,这是一个通过贝叶斯元控制器动态地将每个token路由到最合适的注意力策略——全softmax注意力、线性(核)注意力或滑动窗口局部注意力——的框架。与使用确定性或无先验学习路由的先前路由方法不同,元控制器将逐token机制选择视为在计算感知的狄利克雷先验下的后验推断:路由权重是由一个使用证据下界目标训练的摊销变分后验q(αxt;ϕ)q(\alpha | x_t; \phi)的输出,该目标联合编码了任务性能和注意力机制成本。这种设计产生了原则性的路由不确定性估计,用于控制软到硬的路由转换,在没有临时负载平衡损失的情况下缓解路由崩溃,并以可忽略的开销产生比确定性或无先验学习路由更好的计算-性能权衡。在小型LM基准上的第一阶段实证结果证实了核心预测:贝叶斯控制器的学习路由分布意味着在硬路由下归一化FLOP成本为25.1%,而无先验基线为59.3%(降低34.2个百分点),并将路由熵从55.8%降低到43.3%(降低12.5个百分点),表明狄利克雷先验防止了路由崩溃,而非贝叶斯模型则默认使用全注意力。我们介绍了贝叶斯架构、ELBO训练目标以及一个验证前向传播正确性、后验多样性和与无先验基线进行受控消融实验的第一阶段PyTorch原型。代码可在https://github.com/KFEAL/meta-attention获取。

关键词

引用

@article{arxiv.2605.28384,
  title  = {Meta-Attention: Bayesian Per-Token Routing for Efficient Transformer Inference},
  author = {Alan Ferrari},
  journal= {arXiv preprint arXiv:2605.28384},
  year   = {2026}
}