AntMan:通过稀疏低秩压缩加速 RNN 推理
机器学习
2019-10-07 v1 机器学习
摘要
基于复杂 RNN 的模型的广泛采用受其推理性能、成本与内存需求的阻碍。为解决此问题,我们开发了 AntMan,协同结合结构化稀疏与低秩分解,以降低 RNN 的计算量、规模与执行时间,同时达到所需精度。AntMan 扩展基于知识蒸馏的训练以高效学习压缩模型。我们的评估显示,对于语言与机器阅读理解模型,AntMan 在精度下降小于 1pt 的情况下可实现高达 100 倍的算力削减。我们的评估还显示,在给定精度目标下,AntMan 生成的模型比最先进方法小 5 倍。最后,我们展示 AntMan 相比理论加速比具有超线性速度提升,证明了其在商用硬件上的实用价值。
引用
@article{arxiv.1910.01740,
title = {AntMan: Sparse Low-Rank Compression to Accelerate RNN inference},
author = {Samyam Rajbhandari and Harsh Shrivastava and Yuxiong He},
journal= {arXiv preprint arXiv:1910.01740},
year = {2019}
}