中文

利用 RMT 将 Transformer 扩展至 100 万 token 及以上

计算与语言 2024-02-07 v2 人工智能 机器学习

摘要

Transformer 可解问题范围的一大局限在于计算复杂度随输入规模呈二次方增长。本研究探究对预训练 Transformer 模型进行循环记忆增强,以在线性扩展计算的同时延长输入上下文长度。我们的方法展现出在记忆中存储长达前所未有的两百万 token 序列信息的能力,且保持高检索准确率。在语言建模任务上的实验表明,随着已处理输入段数量增加,困惑度得以改善。这些结果凸显了方法的有效性,其在自然语言理解与生成任务的长程依赖处理方面具有显著潜力,并能够支撑内存密集型应用的大规模上下文处理。

关键词

引用

@article{arxiv.2304.11062,
  title  = {Scaling Transformer to 1M tokens and beyond with RMT},
  author = {Aydar Bulatov and Yuri Kuratov and Yermek Kapushev and Mikhail S. Burtsev},
  journal= {arXiv preprint arXiv:2304.11062},
  year   = {2024}
}