LongNet:将 Transformer 扩展至十亿级词元
计算与语言
2023-07-20 v2 机器学习
摘要
在大型语言模型时代,扩展序列长度已成为迫切需求。然而,现有方法或在计算复杂度上、或在模型表达能力上面临困境,导致最大序列长度受限。为解决此问题,我们提出 LongNet,一种 Transformer 变体,可将序列长度扩展至超过 10 亿词元,且不牺牲在较短序列上的性能。具体而言,我们提出膨胀注意力(dilated attention),其随距离增大将注意力范围按指数扩展。LongNet 具有显著优势:1)具有线性计算复杂度,且序列中任意两个词元间存在对数依赖;2)可作为极长序列的分布式训练器;3)其膨胀注意力是标准注意力的直接替换模块,可与现有基于 Transformer 的优化无缝集成。实验结果表明,LongNet 在长序列建模和通用语言任务上均取得强劲性能。我们的工作为建模极长序列开辟了新可能,例如将整个语料库乃至整个互联网视为一个序列。
引用
@article{arxiv.2307.02486,
title = {LongNet: Scaling Transformers to 1,000,000,000 Tokens},
author = {Jiayu Ding and Shuming Ma and Li Dong and Xingxing Zhang and Shaohan Huang and Wenhui Wang and Nanning Zheng and Furu Wei},
journal= {arXiv preprint arXiv:2307.02486},
year = {2023}
}
备注
Work in progress