利用 RMT 将 Transformer 扩展至 100 万 token 及以上
计算与语言
2024-02-07 v2 人工智能
机器学习
摘要
Transformer 可解问题范围的一大局限在于计算复杂度随输入规模呈二次方增长。本研究探究对预训练 Transformer 模型进行循环记忆增强,以在线性扩展计算的同时延长输入上下文长度。我们的方法展现出在记忆中存储长达前所未有的两百万 token 序列信息的能力,且保持高检索准确率。在语言建模任务上的实验表明,随着已处理输入段数量增加,困惑度得以改善。这些结果凸显了方法的有效性,其在自然语言理解与生成任务的长程依赖处理方面具有显著潜力,并能够支撑内存密集型应用的大规模上下文处理。
引用
@article{arxiv.2304.11062,
title = {Scaling Transformer to 1M tokens and beyond with RMT},
author = {Aydar Bulatov and Yuri Kuratov and Yermek Kapushev and Mikhail S. Burtsev},
journal= {arXiv preprint arXiv:2304.11062},
year = {2024}
}