APNN-TC:在 Ampere GPU 张量核上加速任意精度神经网络
分布式、并行与集群计算
2021-11-18 v2 人工智能
硬件体系结构
计算机视觉与模式识别
摘要
多年来,利用量化加速神经网络已被广泛研究。遗憾的是,先前具有多样精度(例如 1-bit 权重和 2-bit 激活)的努力通常受限于 GPU 上有限的精度支持(例如 int1 和 int4)。为打破此类限制,我们引入了首个任意精度神经网络框架(APNN-TC),以在 Ampere GPU 张量核上充分利用量化优势。具体而言,APNN-TC 首先引入一种新颖的仿真算法,利用 int1 计算原语以及 XOR/AND 布尔运算支持任意短位宽计算。其次,APNN-TC 集成了任意精度层设计,通过新颖的批处理策略和专门的内存组织将我们的仿真算法高效映射到张量核。第三,APNN-TC 体现了一种新颖的任意精度神经网络设计,以最小化层间内存访问并进一步提升性能。大量评估表明,APNN-TC 相比 CUTLASS 核以及各种神经网络模型(如 ResNet 和 VGG)可实现显著加速。
引用
@article{arxiv.2106.12169,
title = {APNN-TC: Accelerating Arbitrary Precision Neural Networks on Ampere GPU Tensor Cores},
author = {Boyuan Feng and Yuke Wang and Tong Geng and Ang Li and Yufei Ding},
journal= {arXiv preprint arXiv:2106.12169},
year = {2021}
}
备注
Accepted by SC'21