中文

使用 LMU 的语言建模:相比 Transformer 提升 10 倍数据效率或改进缩放性

机器学习 2021-10-07 v1 计算与语言

摘要

近期研究表明,Transformer 在语言建模任务上的性能与模型规模在六个数量级上服从幂律关系。虽然 Transformer 展现出令人印象深刻的缩放性,但其性能依赖于处理大量数据,且计算和内存需求随序列长度呈二次增长。受这些考量驱动,我们构建了一个基于 Legendre Memory Unit 的模型,该模型引入了用于序列处理的通用先验,并分别表现出 O(n)O(n)O(nlnn)O(n \ln n)(或更好)的内存与计算依赖关系。在三个数量级上,我们展示新架构以少 10 倍的 token 达到了与 Transformer 相同的准确率。我们还展示,在相同的训练量下,我们的模型相比 Transformer 降低的损失大约相当于 Transformer 相比 LSTM 降低的损失。此外,我们证明加入全局自注意力可补充我们的架构,且增强后的模型进一步提升了性能。

关键词

引用

@article{arxiv.2110.02402,
  title  = {Language Modeling using LMUs: 10x Better Data Efficiency or Improved Scaling Compared to Transformers},
  author = {Narsimha Chilkuri and Eric Hunsberger and Aaron Voelker and Gurshaant Malik and Chris Eliasmith},
  journal= {arXiv preprint arXiv:2110.02402},
  year   = {2021}
}