一个宽前馈网络足矣
计算与语言
2023-10-24 v2 人工智能
摘要
Transformer 架构有两个主要的非嵌入组件:注意力机制与前馈网络 (FFN)。注意力机制捕获词语间与位置无关的相互依赖关系,而 FFN 独立地对每个输入词元进行非线性变换。在本工作中,我们探究 FFN 的作用,发现尽管其占据模型参数的很大一部分,它却高度冗余。具体而言,通过移除解码器层上的 FFN 并在编码器间共享单个 FFN,我们能够在仅轻微降低精度的情况下大幅减少参数数量。最后,我们通过增大共享 FFN 的隐藏维度将该架构扩展回原始规模,相对于原始 Transformer Big 在精度与延迟上均取得显著提升。
引用
@article{arxiv.2309.01826,
title = {One Wide Feedforward is All You Need},
author = {Telmo Pessoa Pires and António V. Lopes and Yannick Assogba and Hendra Setiawan},
journal= {arXiv preprint arXiv:2309.01826},
year = {2023}
}
备注
Accepted at WMT23 (EMNLP 2023)