中文

基于动态值注意力的 Transformer 重构

机器学习 2025-12-30 v1

摘要

自2017年 Transformer 提出以来,已提出多种方法进行优化。然而,Transformer的主要结构保持不变,忽略了其内在主要局限之一,即每个查询头使用相同的静态值。 Transformer本身通过实现多头注意力来试图解决这一问题,但注意力头的数量受复杂度限制。我提出了一种为每个查询动态决定值的方法,这可以消除所有冗余的注意力头,仅保留一个。因此,后续的前馈网络可以完全被消除,因为每个修订后的嵌入已经获取了超过上下文语境的大量有用值。结果是,仅需一个单头 Dynamic Value Attention(DVA)即可满足 Transformer 的全部需求。根据实验,DVA在训练时间上比原始 Transformer 节省37.6%,同时提升学习能力。

关键词

引用

@article{arxiv.2512.22212,
  title  = {Transformer Reconstructed with Dynamic Value Attention},
  author = {Xiaowei Wang},
  journal= {arXiv preprint arXiv:2512.22212},
  year   = {2025}
}