使用 LMU 的语言建模:相比 Transformer 提升 10 倍数据效率或改进缩放性
机器学习
2021-10-07 v1 计算与语言
摘要
近期研究表明,Transformer 在语言建模任务上的性能与模型规模在六个数量级上服从幂律关系。虽然 Transformer 展现出令人印象深刻的缩放性,但其性能依赖于处理大量数据,且计算和内存需求随序列长度呈二次增长。受这些考量驱动,我们构建了一个基于 Legendre Memory Unit 的模型,该模型引入了用于序列处理的通用先验,并分别表现出 和 (或更好)的内存与计算依赖关系。在三个数量级上,我们展示新架构以少 10 倍的 token 达到了与 Transformer 相同的准确率。我们还展示,在相同的训练量下,我们的模型相比 Transformer 降低的损失大约相当于 Transformer 相比 LSTM 降低的损失。此外,我们证明加入全局自注意力可补充我们的架构,且增强后的模型进一步提升了性能。
引用
@article{arxiv.2110.02402,
title = {Language Modeling using LMUs: 10x Better Data Efficiency or Improved Scaling Compared to Transformers},
author = {Narsimha Chilkuri and Eric Hunsberger and Aaron Voelker and Gurshaant Malik and Chris Eliasmith},
journal= {arXiv preprint arXiv:2110.02402},
year = {2021}
}