中文

用反馈记忆解决 Transformer 的一些局限性

机器学习 2021-01-26 v3 计算与语言 机器学习

摘要

尽管 Transformer 是前馈网络,它们已成功应用于序列自回归任务。与循环神经网络不同,Transformer 使用注意力来捕捉时间关系,同时并行处理输入词元。虽然这种并行化使其计算高效,但它限制了模型充分利用输入的序列性质。给定层的表示只能访问来自较低层的表示,而非已有的更高层表示。在本文中,我们提出反馈 Transformer 架构,其将所有先前的表示暴露给所有未来的表示,意味着当前时间步的最低层表示由过去最高层次的抽象表示构成。我们在语言建模、机器翻译和强化学习的多种基准上证明,增加的表示容量可以创建出体积小、层数浅但比可比 Transformer 性能更强的小型模型。

关键词

引用

@article{arxiv.2002.09402,
  title  = {Addressing Some Limitations of Transformers with Feedback Memory},
  author = {Angela Fan and Thibaut Lavril and Edouard Grave and Armand Joulin and Sainbayar Sukhbaatar},
  journal= {arXiv preprint arXiv:2002.09402},
  year   = {2021}
}