算法到编译协同设计:神经网络稀疏性的集成视角
机器学习
2021-06-18 v2 人工智能
计算与语言
系统与控制
系统与控制
摘要
降低神经网络的计算成本、推理延迟与内存占用常被引为剪枝与稀疏性的研究动机。然而,将这些收益落地,并理解算法设计与正则化对运行时执行的端到端影响,却鲜有深入考察。在此,我们对 BERT 语言模型的 transformer 块的注意力权重施加结构化与非结构化剪枝,同时扩展 TVM 编译器中的块稀疏表示(BSR)操作。BSR 操作的集成使 TVM 运行时执行能够利用由模型正则化引发的结构化模式稀疏性。这种剪枝算法的集成视角使我们能够研究建模决策与其对稀疏性增强执行的直接影响之间的关系。我们的主要发现是:1)我们验证了结构化稀疏块正则化的性能收益必须由对 TVM 的 BSR 扩充来启用,相对于原生 PyTorch 有 4 倍加速,相对于标准 TVM 编译(无扩展 BSR 支持)有 2.2 倍加速。2)对于 BERT 注意力权重,此 CPU 推理上下文中的端到端最优块稀疏形状不是方块(如 \cite{gray2017gpu} 中),而是线性的 32x1 块。3)性能与块大小/形状之间的关系暗示了模型正则化参数如何与任务调度器优化相互作用,从而产生观测到的端到端性能。
引用
@article{arxiv.2106.08846,
title = {Algorithm to Compilation Co-design: An Integrated View of Neural Network Sparsity},
author = {Fu-Ming Guo and Austin Huang},
journal= {arXiv preprint arXiv:2106.08846},
year = {2021}
}