中文

利用并行注意力与前馈网络设计探究Transformer中前馈网络的作用

计算与语言 2023-05-26 v2

摘要

本文通过采用并行注意力与前馈网络设计(PAF)架构,并将其与串行注意力与前馈网络设计(SAF)对应架构进行比较,研究前馈网络(FFNs)在Transformer模型中的关键作用。PAF有效性的核心在于关于层中FFN块与注意力块的两个主要假设:1)FFN块的主要功能是维持词元嵌入的各向同性并防止其退化;2)注意力块中计算的残差范数显著小于输入词元嵌入范数。为实证验证这些假设,我们训练了两种大语言模型(RoBERTa-large与bert-large-uncased)的PAF变体。结果表明,这两个假设在PAF设计中均成立。本研究增进了对Transformer架构中FFN与自注意力机制的作用及相互作用的理解。

关键词

引用

@article{arxiv.2305.13297,
  title  = {Investigating the Role of Feed-Forward Networks in Transformers Using Parallel Attention and Feed-Forward Net Design},
  author = {Shashank Sonkar and Richard G. Baraniuk},
  journal= {arXiv preprint arXiv:2305.13297},
  year   = {2023}
}