中文

带外源锚点的注意力投影混合

计算与语言 2026-05-28 v4

摘要

跨层重用早期注意力投影可改善优化与数据效率,但会产生结构性冲突:第一层必须同时作为所有更深层的稳定、可重用锚点,又要作为有效计算模块。我们展示了这种张力如何限制内部锚点设计的性能。我们提出 ExoFormer,通过在序列层堆栈之外学习外源锚点投影来解决冲突。我们引入统一的归一化混合框架,使用可学习系数混合查询、键、值和门逻辑 (探索系数粒度:元素级、头级和标量),并指出归一化锚点来源对稳定重用至关重要。ExoFormer 变体持续超越其内部锚点对应方案,动态变体在使用 1.5 倍 token 数的情况下,仅匹配 Gated Attention 验证损失,却获得 1.5 倍下游准确率。我们通过外部锚点保留关键 token 身份,使层能够专注于特征转换,解释了这种有效性——即卸载假设。我们发布代码和模型以促进未来研究。

关键词

引用

@article{arxiv.2601.08131,
  title  = {Attention Projection Mixing with Exogenous Anchors},
  author = {Jonathan Su},
  journal= {arXiv preprint arXiv:2601.08131},
  year   = {2026}
}