中文

重新思考注意力:探索浅层前馈神经网络作为 Transformer 中注意力层的替代方案

计算与语言 2024-02-06 v4 机器学习

摘要

本工作分析了使用标准浅层前馈网络来模仿原始 Transformer 模型中注意力机制行为的有效性,Transformer 是用于序列到序列任务的先进架构。我们用简单的前馈网络替换 Transformer 中注意力机制的关键组件,并通过知识蒸馏使用原始组件进行训练。我们在 IWSLT2017 数据集上进行的实验揭示了这些“无注意力 Transformer”媲美原始架构性能的能力。通过严格的消融研究,并尝试各种替换网络类型与规模,我们提供了支持该方法可行性的见解。这不仅阐明了浅层前馈网络在模拟注意力机制方面的适应性,也凸显了其在简化序列到序列任务复杂架构上的潜力。

关键词

引用

@article{arxiv.2311.10642,
  title  = {Rethinking Attention: Exploring Shallow Feed-Forward Neural Networks as an Alternative to Attention Layers in Transformers},
  author = {Vukasin Bozic and Danilo Dordevic and Daniele Coppola and Joseph Thommes and Sidak Pal Singh},
  journal= {arXiv preprint arXiv:2311.10642},
  year   = {2024}
}

备注

Accepted at AAAI24(https://aaai.org/aaai-conference/)