利用并行注意力与前馈网络设计探究Transformer中前馈网络的作用
计算与语言
2023-05-26 v2
摘要
本文通过采用并行注意力与前馈网络设计(PAF)架构,并将其与串行注意力与前馈网络设计(SAF)对应架构进行比较,研究前馈网络(FFNs)在Transformer模型中的关键作用。PAF有效性的核心在于关于层中FFN块与注意力块的两个主要假设:1)FFN块的主要功能是维持词元嵌入的各向同性并防止其退化;2)注意力块中计算的残差范数显著小于输入词元嵌入范数。为实证验证这些假设,我们训练了两种大语言模型(RoBERTa-large与bert-large-uncased)的PAF变体。结果表明,这两个假设在PAF设计中均成立。本研究增进了对Transformer架构中FFN与自注意力机制的作用及相互作用的理解。
引用
@article{arxiv.2305.13297,
title = {Investigating the Role of Feed-Forward Networks in Transformers Using Parallel Attention and Feed-Forward Net Design},
author = {Shashank Sonkar and Richard G. Baraniuk},
journal= {arXiv preprint arXiv:2305.13297},
year = {2023}
}