SAMP:一种基于自适应混合精度的文本处理训练后量化模型推理工具包
机器学习
2023-12-19 v2 计算与语言
摘要
最新的工业推理引擎,如 FasterTransformer 和 TurboTransformers,已验证半精度浮点(FP16)与 8 位整数(INT8)量化可大幅提升模型推理速度。然而,现有 INT8 量化方法过于复杂,不当使用会导致模型性能严重受损。本文开发了一款供用户轻松量化其模型以进行推理的工具包,其中提出自适应混合精度(SAMP)通过混合精度架构自动调控量化率,以平衡模型精度与效率。实验结果表明,我们的 SAMP 工具包在确保所需精度的同时,比 PyTorch 和 FasterTransformer 具有更高的加速比。此外,SAMP 基于模块化设计,解耦分词器、嵌入层、编码器与目标层,使用户能够处理各类下游任务并可无缝集成至 PyTorch。
引用
@article{arxiv.2209.09130,
title = {SAMP: A Model Inference Toolkit of Post-Training Quantization for Text Processing via Self-Adaptive Mixed-Precision},
author = {Rong Tian and Zijing Zhao and Weijie Liu and Haoyan Liu and Weiquan Mao and Zhe Zhao and Kan Zhou},
journal= {arXiv preprint arXiv:2209.09130},
year = {2023}
}
备注
This paper was accepted by EMNLP2023