通过 Turing GPU 中的位张量核加速二值化神经网络
分布式、并行与集群计算
2020-12-16 v2 机器学习
摘要
尽管二值化神经网络(BNNs)相较传统深度神经网络有望获得巨大加速,但其性能优势仅在 CPU 和 GPU 等通用处理器上得以展示。事实上,由于无法在基于字长的架构下利用位级并行,GPU 在执行 BNN 时因利用率极低(1%)而受到批评。因此,NVIDIA Turing GPU 中的最新张量核开始实验性支持位计算。本工作中,我们考察这一全新的位计算能力并刻画其独特特征。我们表明内存访问的步幅会显著影响性能发挥,且高度需要一种数据格式协同设计以支持张量核实现优于现有无张量核软件方案的卓越性能。我们实现了张量核加速的 BNN 设计,特别是全连接层和卷积层的主要函数——位矩阵乘法与位卷积。在两款 NVIDIA Turing GPU 上的评估显示,使用 ResNet-18,我们的 BTC-BNN 设计能以每秒 5.6K 张图像的速率处理 ImageNet,比最先进水平快 77%。我们的 BNN 方法发布于 https://github.com/pnnl/TCBNN。
引用
@article{arxiv.2006.16578,
title = {Accelerating Binarized Neural Networks via Bit-Tensor-Cores in Turing GPUs},
author = {Ang Li and Simon Su},
journal= {arXiv preprint arXiv:2006.16578},
year = {2020}
}
备注
This work has already been accepted by IEEE Transactions on Parallel and Distributed Systems (TPDS) Special Section on Parallel and Distributed Computing Techniques for AI/ML/DL