基于 Transformer 模型的块级比特压缩
计算与语言
2023-04-04 v2 机器学习
摘要
随着以 BERT、GPT-3 和 ChatGPT 为代表的近期 Transformer 基模型的流行,一系列自然语言处理任务取得了最先进的性能。然而,Transformer 基模型巨大的计算量、庞大的内存占用以及由此产生的高延迟,对具有高实时性要求的云端服务而言是不可回避的挑战。为解决该问题,我们提出 BBCT,一种无需重训练的 Transformer 块级比特压缩方法。我们的方法实现了对整个 Transformer 更细粒度的压缩,包括嵌入、矩阵乘法、GELU、softmax、层归一化以及所有中间结果。作为案例,我们使用 BBCT 方法压缩了一个高效 BERT。我们在通用语言理解评估(GLUE)上的基准测试结果表明,BBCT 在大多数任务中能实现低于 1% 的精度下降。
引用
@article{arxiv.2303.09184,
title = {Block-wise Bit-Compression of Transformer-based Models},
author = {Gaochen Dong and Wei Chen},
journal= {arXiv preprint arXiv:2303.09184},
year = {2023}
}
备注
Need to add figures and adjust languages to improve readability