中文

基于学习置换的高效动态结构化稀疏训练

机器学习 2025-10-17 v1

摘要

结构化稀疏性在现代GPU上加速了训练和推理,但其精度仍落后于非结构化动态稀疏训练(DST)。这种不足源于表达能力的损失:稠密层可以实现从n个权重中选择任意w个活跃权重所得到的每一种可能的掩码,而固定的块或N:M布局仅探索这些可能性中的一个子集。我们提出通过学习每个层的单一置换矩阵与结构化权重矩阵联合训练来弥合这一差距。应用于三种典型结构——块、N:M和对角线——我们展示了增强置换的DST(PA-DST)在ImageNet-1K(ViT-B/16)和WikiText-103(GPT-2)上,在90-95%稀疏度下匹配了非结构化基线(RigL, SET),同时训练速度提升高达1.21倍,推理速度提升高达2.9倍。这些结果将结构+学习到的置换定位为精度和效率之间的最佳平衡点。

关键词

引用

@article{arxiv.2510.14812,
  title  = {Efficient Dynamic Structured Sparse Training with Learned Shuffles},
  author = {Abhishek Tyagi and Arjun Iyer and Liam Young and William H Renninger and Christopher Kanan and Yuhao Zhu},
  journal= {arXiv preprint arXiv:2510.14812},
  year   = {2025}
}