中文

多极语义注意力:用于预训练的 Softmax 注意力快速近似

机器学习 2026-02-16 v3

摘要

在长序列(整个代码库、相关文档集合)上预训练 Transformer 受到二次注意力成本的瓶颈制约。我们提出了多极语义注意力,将 64k 上下文预训练加速了 36%,同时匹配基线损失,且无需任何架构更改。MuSe 在表示空间中分别对查询和键进行聚类。这产生了特定于查询的摘要,在匹配稀疏度下显著优于空间分块,同时还能实现与现有预训练模型的即插即用兼容性;我们在 Llama 3.1-8B 和 3.2-1B 上无需重新训练即进行了验证。我们在代码和科学文档上以 64k 上下文预训练了多达 1B 参数的语言模型,证实 MuSe 在训练期间保持了质量和长上下文利用率。

关键词

引用

@article{arxiv.2509.10406,
  title  = {Multipole Semantic Attention: A Fast Approximation of Softmax Attention for Pretraining},
  author = {Rupert Mitchell and Kristian Kersting},
  journal= {arXiv preprint arXiv:2509.10406},
  year   = {2026}
}