中文

一个宽前馈网络足矣

计算与语言 2023-10-24 v2 人工智能

摘要

Transformer 架构有两个主要的非嵌入组件:注意力机制与前馈网络 (FFN)。注意力机制捕获词语间与位置无关的相互依赖关系,而 FFN 独立地对每个输入词元进行非线性变换。在本工作中,我们探究 FFN 的作用,发现尽管其占据模型参数的很大一部分,它却高度冗余。具体而言,通过移除解码器层上的 FFN 并在编码器间共享单个 FFN,我们能够在仅轻微降低精度的情况下大幅减少参数数量。最后,我们通过增大共享 FFN 的隐藏维度将该架构扩展回原始规模,相对于原始 Transformer Big 在精度与延迟上均取得显著提升。

关键词

引用

@article{arxiv.2309.01826,
  title  = {One Wide Feedforward is All You Need},
  author = {Telmo Pessoa Pires and António V. Lopes and Yannick Assogba and Hendra Setiawan},
  journal= {arXiv preprint arXiv:2309.01826},
  year   = {2023}
}

备注

Accepted at WMT23 (EMNLP 2023)