AdaSplash:自适应稀疏闪光注意力
计算与语言
2025-06-10 v2 机器学习
摘要
基于softmax注意力的计算成本限制了transformer在长上下文任务中的应用。其中一种自适应稀疏性方法——-entmax注意力——提供了灵活的数据依赖性替代方案,但现有实现效率低下,未能利用稀疏性获得运行时和内存收益。本文提出AdaSplash,将GPU优化算法的效率与-entmax的稀疏性优势相结合。我们首先引入混合Halley-二分算法,使计算-entmax变换所需的迭代次数降低7倍。随后,我们实现自定义Triton内核,高效处理自适应稀疏性。针对RoBERTa和ModernBERT的文本分类和单向量检索,以及GPT-2的语言建模进行实验,结果表明我们的方法在运行时和内存效率方面显著优于现有-entmax实现。它接近——在某些情况下甚至超过——高度优化的softmax实现如FlashAttention-2,从而实现长上下文训练,同时保持出色的任务性能。
引用
@article{arxiv.2502.12082,
title = {AdaSplash: Adaptive Sparse Flash Attention},
author = {Nuno Gonçalves and Marcos Treviso and André F. T. Martins},
journal= {arXiv preprint arXiv:2502.12082},
year = {2025}
}
备注
Accepted as spotlight in ICML 2025