中文

Top-Theta Attention:通过补偿阈值法稀疏化 Transformer

计算与语言 2025-08-25 v2 人工智能

摘要

我们提出 Top-Theta(Top-θ\theta)Attention,一种用于在推理过程中稀疏化 Transformer 注意力的无需训练方法。我们的关键洞察在于,可以通过校准每个注意力头的静态阈值,来保留每行注意力中期望的显著元素数量。该方法实现了基于内容的稀疏性,无需重新训练,并且在不同数据域上保持鲁棒性。我们进一步引入补偿技术,以在激进的稀疏化条件下保持准确性,将注意力阈值法确立为 top-k 注意力的一种实用且有原则的替代方案。我们在自然语言处理任务上进行了广泛评估,结果表明 Top-θ\theta 在推理过程中可将 V-cache 使用量减少 3–10 倍,注意力元素数量减少最多 10 倍,同时准确率下降不超过 1%。

关键词

引用

@article{arxiv.2502.08363,
  title  = {Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding},
  author = {Konstantin Berestizshevsky and Renzo Andri and Lukas Cavigelli},
  journal= {arXiv preprint arXiv:2502.08363},
  year   = {2025}
}

备注

11 pages, 11 figures + Appendix. work under submission