TDC:通过硬件感知的Tucker分解在GPU上实现极高效率CNN
分布式、并行与集群计算
2023-01-06 v2
摘要
Tucker分解是SOTA的CNN模型压缩技术之一。然而,与FLOPs的减少不同,我们观察到使用cuDNN等现有GPU软件时,Tucker压缩模型的推理时间减少非常有限。为此,我们提出了一个高效的端到端框架,可通过Tucker分解和在GPU上优化的推理代码生成高精度且紧凑的CNN模型。具体而言,我们提出一种基于ADMM的训练算法,可得到高精度的Tucker格式模型。我们还开发了用于Tucker格式卷积的高性能核以及分析性性能模型,以指导执行参数的选择。我们进一步提出一个协同设计框架,由实际推理时间(而非FLOPs)驱动来确定合适的Tucker秩。我们在五种现代CNN上基于A100的评估表明,我们的压缩模型配合优化代码相较cuDNN实现高达2.21倍加速,较TVM达1.12倍加速,较使用cuDNN的原始模型达3.27倍加速,且精度损失至多0.05%。
引用
@article{arxiv.2211.03715,
title = {TDC: Towards Extremely Efficient CNNs on GPUs via Hardware-Aware Tucker Decomposition},
author = {Lizhi Xiang and Miao Yin and Chengming Zhang and Aravind Sukumaran-Rajam and P. Sadayappan and Bo Yuan and Dingwen Tao},
journal= {arXiv preprint arXiv:2211.03715},
year = {2023}
}
备注
14 pages, 9 figures, 3 tables, accepted by PPoPP '23