中文

跟我重复:Transformer在复制任务上优于状态空间模型

机器学习 2024-06-05 v2 人工智能 计算与语言

摘要

Transformer是序列建模的主导架构,但人们对使用不依赖于序列长度的固定大小隐状态模型(我们称之为“广义状态空间模型”(GSSMs))的兴趣日益增长。在本文中,我们表明,尽管GSSMs在推理效率方面很有前景,但在需要从输入上下文进行复制的任务上,它们与Transformer模型相比存在局限性。我们首先对简单的字符串复制任务进行了理论分析,并证明两层Transformer可以复制指数长度的字符串,而GSSMs从根本上受限于其固定大小的隐状态。从经验上看,我们发现Transformer在需要复制上下文的合成任务上,在效率和泛化能力方面均优于GSSMs。最后,我们评估了预训练的大语言模型,发现Transformer模型在从上下文中复制和检索信息方面显著优于状态空间模型。综上所述,这些结果表明,在实际应用的任务上,Transformer和GSSMs之间存在根本性的差距。

关键词

引用

@article{arxiv.2402.01032,
  title  = {Repeat After Me: Transformers are Better than State Space Models at Copying},
  author = {Samy Jelassi and David Brandfonbrener and Sham M. Kakade and Eran Malach},
  journal= {arXiv preprint arXiv:2402.01032},
  year   = {2024}
}