基于注意力张量化的长序列建模:从序列到张量学习
计算与语言
2025-05-26 v2
摘要
随着对处理长文本数据需求的增长,处理长程依赖和保持计算效率的能力比以往任何时候都更为关键。基于注意力的模型在长序列建模中的一个关键问题是,全注意力的有限范围建模能力与输入序列中的长程 token 依赖性之间的不匹配。在这项工作中,我们提出通过将长输入序列张量化为紧凑的张量表示,随后在每个变换维度上进行注意力,来扩大注意力感受野。由此产生的张量化注意力可以作为高效的 Transformer 主干,以更高的内存和时间效率扩展输入上下文长度。我们表明,所提出的注意力张量化将 token 依赖性编码为多跳注意力过程,并且等价于全注意力的 Kronecker 分解。大量实验表明,张量化注意力可用于适配预训练 LLM,并提高效率。值得注意的是,带有张量化的 Llama-8B 在 32,768 上下文长度下进行训练,并且在推理期间能够稳定外推至 128k 长度,与使用 FlashAttention-2 的全注意力相比实现了 的加速。
引用
@article{arxiv.2410.20926,
title = {Long Sequence Modeling with Attention Tensorization: From Sequence to Tensor Learning},
author = {Aosong Feng and Rex Ying and Leandros Tassiulas},
journal= {arXiv preprint arXiv:2410.20926},
year = {2025}
}