加速扩散语言模型的PulseCol:周期刷新稀疏列注意力
计算与语言
2026-05-21 v1
摘要
扩散大型语言模型(dLLMs)的推理计算成本高昂,因为在去噪过程中每个步骤都必须重复执行完整的自注意力计算,且无法使用KV缓存。最近的稀疏注意力方法通过仅在后期迭代中应用块稀疏计算来缓解此成本,而后期模型性能对粗糙稀疏近似较不敏感,但仅带来有限的计算效率和加速提升。这促使我们采用一种可从早期迭代开始且利用可重复稀疏模式的更细粒度稀疏化策略,以实现更大的效率收益。在本工作中,我们引入PulseCol,这是一种用于加速扩散语言模型的周期刷新稀疏列注意力方法。PulseCol以更细粒度的列稀疏结构取代粗糙的块级稀疏性,允许重要注意力相互作用更精确地保留,同时暴露更大的稀疏性。基于该列级表述,PulseCol进一步识别早期去噪步骤中的稀疏模式,并在后续迭代中复用这些模式,仅在少数中间步骤刷新,以跟踪去噪期间稀疏注意力模式的演变。实验表明,PulseCol在计算稀疏性和实际加速方面优于扩散语言模型的先前稀疏注意力方法,同时保持模型质量。借助针对列稀疏注意力的优化GPU内核,PulseCol在多个上下文长度上实现了最高达1.95倍的端到端加速。
引用
@article{arxiv.2605.20813,
title = {PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language Models},
author = {Yanyi Lyu and Letian Chen and Futing Sun and Miao Zhang and Weili Guan and Liqiang Nie},
journal= {arXiv preprint arXiv:2605.20813},
year = {2026}
}