中文

具有持久记忆的紧凑型循环转换器

机器学习 2025-05-05 v1 机器学习

摘要

Transformer 架构在许多语言处理和视觉任务中显示出显著的成功。然而,该方法在面临将其规模有效扩展到长序列的挑战时,因自注意力计算相对于输入长度呈二次增长。为克服这一限制,Several 种方法通过将长序列分为一系列段来扩展到更长的序列,将自注意力限制在每个段内的标记之间的局部依赖关系,并使用记忆机制来管理段之间信息流。然而,这些方法通常引入额外的计算开销,这限制了它们用于有限计算内存和能源的应用(如边缘计算)。我们提出一种新颖且高效的紧凑型循环转换器(CRT),其结合处理短局部段的浅层 Transformer 模型与循环神经网络,以压缩和管理总结长期全球信息的单个持久记忆向量。我们在 WordPTB 和 WikiText-103 上进行评估,用于 next-token-prediction 任务,以及在丰田智能家居视频数据集上进行分类。CRT 在语言数据集上实现了与完整长度 Transformer 相当或更好的预测结果,同时使用显著缩短的段(大小为一半或四分之一)和大幅度减少的 FLOPs。我们的方法在丰田智能家居视频数据集上也展示了最先进的性能。

关键词

引用

@article{arxiv.2505.00929,
  title  = {Compact Recurrent Transformer with Persistent Memory},
  author = {Edison Mucllari and Zachary Daniels and David Zhang and Qiang Ye},
  journal= {arXiv preprint arXiv:2505.00929},
  year   = {2025}
}