自调节稀疏注意力:变分超参数优化的 Transformer 加速
机器学习
2026-03-20 v1 人工智能
摘要
稀疏注意力机制承诺突破长上下文 Transformer 的二次瓶颈,但生产部署受限于关键可用性差距:最优超参数在不同层和模型间差异显著,现有方法(如 SpargeAttn)依赖人工网格搜索来识别它们。我们提出 AFBS-BO(Adaptive Fidelity Binary Search with Bayesian Optimization),一个完全自动化的框架,无需人工干预即可发现层级和头特定的超参数。我们的混合算法将贝叶斯优化用于全局探索,结合二分查找进行局部精炼,利用跨序列长度的多保真度评估以降低调参成本。在 Llama-2-7B 上,AFBS-BO 比网格搜索快 3.4 倍,评估次数减少 8.8 倍,并识别出超越现有稀疏注意力基线的高稀疏度配置,同时与稠密注意力质量接近。通过将稀疏注意力从手动调谐的启发式方法转化为自优化的基本单元,AFBS-BO 实现跨多样化 Transformer 架构和领域的即插即用加速。
引用
@article{arxiv.2603.18417,
title = {Self-Tuning Sparse Attention: Multi-Fidelity Hyperparameter Optimization for Transformer Acceleration},
author = {Arundhathi Dev and Justin Zhan},
journal= {arXiv preprint arXiv:2603.18417},
year = {2026}
}
备注
Accepted to the International Conference on Machine Intelligence Theory and Applications (MiTA 2026)