中文

TorchSparse++:面向GPU上稀疏卷积的高效训练与推理框架

分布式、并行与集群计算 2023-11-23 v1 计算机视觉与模式识别 机器学习 性能

摘要

稀疏卷积在新兴工作负载中起着关键作用,包括AR/VR中的点云处理、自动驾驶,以及推荐系统中的图理解。由于计算模式稀疏且不规则,需要专门的高性能核函数。现有GPU库为稀疏卷积提供两类数据流。gather-GEMM-scatter数据流易于实现但性能非最优,而具有重叠计算与内存访问的数据流(如implicit GEMM)性能极高但工程成本很高。本文中,我们介绍TorchSparse++,一个新的GPU库,兼具二者之长。我们创建了高效的稀疏核生成器,以低于当前最优系统十分之一工程成本生成高性能稀疏卷积核。在此基础上,我们设计了稀疏自动调优器,扩展了现有稀疏卷积库的设计空间,并为训练和推理工作负载搜索最佳数据流配置。因此,在NVIDIA A100 GPU上,TorchSparse++在推理中相较最优的MinkowskiEngine、SpConv 1.2、TorchSparse和SpConv v2分别实现2.9倍、3.3倍、2.2倍和1.7倍的实测端到端加速;在七个代表性自动驾驶基准的混合精度训练中比SpConv v2快1.2–1.3倍。它还无缝支持图卷积,相较最优图深度学习库实现2.6–7.6倍的更快推理速度。

关键词

引用

@article{arxiv.2311.12862,
  title  = {TorchSparse++: Efficient Training and Inference Framework for Sparse Convolution on GPUs},
  author = {Haotian Tang and Shang Yang and Zhijian Liu and Ke Hong and Zhongming Yu and Xiuyu Li and Guohao Dai and Yu Wang and Song Han},
  journal= {arXiv preprint arXiv:2311.12862},
  year   = {2023}
}

备注

MICRO 2023; Haotian Tang and Shang Yang contributed equally to this project