中文

稀疏更快,少即是多:长范围 Transformer 的高效稀疏注意力

机器学习 2025-02-18 v4 人工智能 计算与语言

摘要

在自回归 Transformer 中,在扩展的上下文窗口内高效地容纳长序列,由于自注意力机制固有的二次计算复杂度和 substantial KV 内存要求,已成为具有显著挑战性。本文我们引入 SPARSEK 注意力,一种新型稀疏注意力机制,旨在克服这些计算和内存障碍,同时保持性能。我们的方法整合了一个评分网络和一个可微分的 top-k 掩码算子 SPARSEK,用于为每个查询选择固定数量的 KV 对,从而实现基于梯度的优化。结果,SPARSEK 注意力在生成期间具有线性时间复杂度和恒定内存占用。实验结果表明,SPARSEK 注意力优于以往稀疏注意力方法,在训练和推理期间提供了显著的速度提升,尤其是在语言建模和下游任务中。此外,我们的方法可以无缝集成到预训练的大型语言模型(LLM)中,只需进行最小的 fine-tuning,即可为在 diverse 应用中有效管理长程依赖提供实用解决方案。

关键词

引用

@article{arxiv.2406.16746,
  title  = {The Responsible Foundation Model Development Cheatsheet: A Review of Tools & Resources},
  author = {Shayne Longpre and Stella Biderman and Alon Albalak and Hailey Schoelkopf and Daniel McDuff and Sayash Kapoor and Kevin Klyman and Kyle Lo and Gabriel Ilharco and Nay San and Maribeth Rauh and Aviya Skowron and Bertie Vidgen and Laura Weidinger and Arvind Narayanan and Victor Sanh and David Adelani and Percy Liang and Rishi Bommasani and Peter Henderson and Sasha Luccioni and Yacine Jernite and Luca Soldaini},
  journal= {arXiv preprint arXiv:2406.16746},
  year   = {2025}
}