中文

RT-Lynx:面向扩散模型的正确稀疏化GEMM

机器学习 2026-05-27 v1

摘要

扩散Transformer(DiT)在图像生成中取得了强大的性能,但在推理成本方面存在较大挑战。虽然先前工作通过量化和蒸馏等方式降低了此成本,但半结构化稀疏化(可将FLOPs近似减半)仍未得到充分探索。一个关键原因是,大多数现有方法关注权重稀疏化,删除50%的权重可能削弱模型容量并降低生成质量。我们的研究表明,DiT激活值本质上是稀疏的,并且对N:M半结构化稀疏化具有显著更强的鲁棒性。基于此观察,我们提出了从权重稀疏化向激活稀疏化的范式转变。我们提出RT-Lynx,将N:M稀疏化应用于激活值,并纳入误差补偿技术以缓解精度损失。我们进一步实现了针对此设置的高度优化CUDA内核,平均在线性层上实现最高可达1.55倍的加速。广泛的实验表明,该方法在保持原始模型生成质量的同时,显著加快了推理速度。

关键词

引用

@article{arxiv.2605.26632,
  title  = {RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models},
  author = {Xing Cong and Hanlin Tang and Kan Liu and Lan Tao and Lin Qu and Chenhao Xie},
  journal= {arXiv preprint arXiv:2605.26632},
  year   = {2026}
}

备注

33 pages, 18 figures, Accepted by ICML 2026